工程筛选报告 · Jay · 2026-07-03 第二轮(下午加筛)

主题:Local Coding Agent Stack + Agent Memory 架构 + DSPy 工作流 + GitHub Trending 新增 + HF 部署命令 检索范围:Substack(Sebastian Raschka / Simon Willison / ByteByteGo)· GitHub Trending · Hugging Face Blog · Lilian Weng · Import AI 去重参考2026-07-03-1050-engineering-filter-harness-agents-llmascode.md(Harness/Claude Code/GPU Scheduling);2026-07-03-afternoon-github-trending-strix-hf-blog-multiagent-rag.md(HF Blog/ScarfBench/Corpus2Skill/GitHub Trending);2026-07-03-1105-briefing-quantization-rag-vecdb-inference.md(Inference benchmark/vLLM vs TRT-LLM vs SGLang)


一、保留条目

✅ R-11:Using Local Coding Agents(Sebastian Raschka · Ahead of AI · Substack)

URL:https://magazine.sebastianraschka.com/p/using-local-coding-agents 发布时间:2026-06(本周RSS收录)

核心工程内容: - 完整 Local Coding Agent Stack 教程:Qwen-Code harness + Qwen3.6 35B-A3B 模型(22GB download),Mac Mini M4 / DGX Spark 均可运行 - 实测硬件需求:~30-40GB RAM,M4 Mac Mini 流畅运行 - Benchmark 数据:基于 Nvidia Polar: Agentic RL on Any Harness at Scale(arXiv:2605.24220,May 2026),Qwen3.5-4B base model 在 Qwen-Code harness 中编码性能最优(Polar-RL 训练前后均为) - Cohere Benchmark(June 2026):Qwen3.6 35B-A3B 在同类尺寸模型中横扫所有 benchmark - 实战经验:同时运行 Codex(GPT latest)+ Qwen-Code(local Qwen)不切换 - Qwen-Code 优势:开源(vs Claude Code 非开源),Qwen 模型针对性优化,支持 Qwen/North Mini Code/Gemma 4 多模型 - Pi(earendil-works/pi):未来值得关注的替代 harness

保留理由: - 具体硬件配置(RAM/芯片/M4 vs DGX Spark)、模型大小(22GB)、benchmark 来源论文(Polar arXiv:2605.24220) - 可复现的本地 Agent 开发环境搭建路径 - 与 awesome-harness-engineering / Claude Code / ECC 形成本地化补充

可信度:⭐⭐⭐⭐⭐ 高——Raschka 长期 AI 教育者,有具体硬件数字和 benchmark 引用 标签Local-Coding-Agent Qwen-Code Qwen3.6 Harness Benchmark Polar-RL 建议分类:Agent Harness 工程 · 本地开发环境 后续行动:精读 Nvidia Polar 论文(arXiv:2605.24220);核验 Qwen3.6 35B-A3B 在 M4 Mac Mini 实测性能


✅ R-12:How AI Agents Manage Memory and Avoid Forgetfulness(ByteByteGo · Substack)

URL:https://blog.bytebytego.com/p/how-ai-agents-manage-memory-and-avoid 发布时间:2026-06-29(本周ByteByteGo RSS)

核心工程内容: - 四层记忆架构(Tiered Memory Hierarchy):类 OS memory paging 设计原则 - Tier 1 · Context Window:最快、最贵(per-token计费)、bounded;直接插入 prompt - Tier 2 · Short-term / Session Memory:最近活动,等待被 summarization 或 eviction - Tier 3 · Long-term Store:跨 session 持久化的事实、embeddings、结构化摘要 - Tier 4 · Cold Archive:低频访问材料,用于审计或未来参考 - 三个关键问题(将完整历史塞入 context 的失败模式): 1. 成本:线性增长对话 → 线性增长 per-call 计费,第80轮可能 re-send 数万 token 2. 延迟:满窗口响应时间从 2s 升至 10-15s 3. Lost-in-the-middle:注意力在长上下文中退化,中间位置信息检索可靠性最低 - 核心论点:"Intelligence resides in the model; memory resides in the system surrounding it"——模型本身无记忆,记忆是外部系统工程的产物 - Memory Tier vs Context Window:更大 context window 不能解决 memory 问题,因为导航问题依然存在

保留理由: - 四层架构框架与 Continuum Memory Architecture(afternoon A-04)相互印证 - "Lost-in-the-middle" 量化了注意力退化对 Agent 记忆可靠性的影响 - 概念清晰,可直接作为 Agent Memory 设计主题页的架构基础

可信度:⭐⭐⭐⭐ 高——ByteByteGo 工程教育型 newsletter,图示清晰,引用来源说明 标签Agent-Memory Memory-Architecture Tiered-Memory Context-Window Lost-in-the-Middle 建议分类:Agent 记忆系统 · 架构设计 后续行动:与 Continuum Memory Architecture(afternoon A-04)合并入 Agent Memory 主题页;补充具体产品(Mem0/E2B/SuperMemory)在四层框架中的对应位置


✅ R-13:Using DSPy to Evaluate and Improve Datasette Agent's SQL System Prompts(Simon Willison)

URL:https://github.com/simonw/research/tree/main/dspy-datasette-agent-prompts 发布时间:2026-07-02(RSS今日收录)

核心工程内容: - DSPy Framework 做 Agent Prompt 工程化评估的实战案例 - Harness 设计:DSPy agents 调用 Datasette Agent 实际工具实现 + live in-process Datasette - Evaluation 数据集:gold-standard auto-generated dataset + custom metrics - 测试模型:GPT 4.1 mini 和 nano - 具体失败模式发现: - Schema listing 只有 table names,不含 column names - "don't call describe_table if you already have the information" advice 导致 column-name guessing(page_count, o.order_id, first_name)→ error-retry loops - 改进建议:schema listing 应包含 column names,或软化该 advice - Reproducibility:GitHub repo 完整可复现(pip install dspy datasette-agent

保留理由: - DSPy 做 prompt optimization 的实际生产案例,不是 toy demo - 具体失败模式(column-name guessing + error-retry loop)有工程诊断价值 - GitHub repo 有完整代码,reproducibility 高 - 与 AgentTrace/observability 工具形成 Agent evaluation + observability 互补

可信度:⭐⭐⭐⭐⭐ 高——Simon Willison 透明公开实验全过程,GitHub repo 可查 标签DSPy Prompt-Engineering Agent-Evaluation Datasette Reproducibility SQL-Agent 建议分类:Agent 评估工程 · Prompt 工程化 后续行动:精读 GitHub repo 完整代码;核验 DSPy prompt optimization 在其他 Agent 场景(不只 Datasette SQL)的通用性


✅ R-14:llm-coding-agent 0.1a0(Simon Willison · Blog)

URL:https://simonwillison.net/2026/Jul/2/llm-coding-agent/ 发布时间:2026-07-02

核心工程内容: - llm-coding-agent 首个 alpha release:llm Python 库的 coding agent 扩展 - Fable 5 实验之一:将 llm 库演进为更偏向 Agent 框架 - 定位:simple coding agent,探索"minimal viable coding harness"边界

保留理由: - 值得追踪的新兴 coding agent 实现(不同于 Claude Code / Codex / Qwen-Code) - 0.1a0 版本号说明是早期实验,与 R-11 Raschka 本地 coding agent 生态形成对照

可信度:⭐⭐⭐ 中——早期 release,需要观察成熟度 标签Coding-Agent llm-library Python Early-Stage 建议分类:Agent 工具链 · 实验性工具 后续行动:关注 0.1 后续版本;与 Qwen-Code / Pi 对比架构差异


✅ R-15:Rethinking Scaling Laws(Lilian Weng · Lil'Log)

URL:https://lilianweng.github.io/posts/2026-06-24-scaling-laws/ 发布时间:2026-06-24(今日RSS收录)

核心工程内容: - Scaling Laws 是深度学习最重要的经验性发现之一 - L(N, D) ∝ N^(-α) + D^(-β) + (ND)^(-γ):模型规模 N、数据规模 D 与训练损失 L 的可预测关系 - 2026 年新背景:GPT-5.5 / DeepSeek V4 / Gemini 4 / Claude 4 等新一代模型 scaling 行为出现新特征 - 覆盖:pre-training scaling / RL scaling / inference scaling laws 的最新进展

保留理由: - Lilian Weng 是 LLM 系统领域高可信度技术作者 - 2026-06-24 非常新,涵盖最新 scaling law 争议(扩展定律是否仍然有效) - 与 Energy-to-Token 推理评估(morning briefing #6)共同构成 LLM 经济学和 scaling 的双重视角

可信度:⭐⭐⭐⭐ 高——Lilian Weng 长期产出高质量技术分析 标签Scaling-Laws LLM-Training RL-Scaling Inference-Scaling 建议分类:LLM 基础研究 · 训练优化 后续行动:精读;与 Energy-to-Token(morning briefing #6)配合阅读


二、丢弃条目

❌ D-09:State of AI: May 2026(Nathan Benaich · Substack)

丢弃理由: - 市场/行业分析报告,非工程实践 - 虽有具体数据($1220亿 OpenAI 合同、Air Street Fund III $232M),但属于投资/战略层面 - 无源码/命令/可复现步骤,不符合工程筛选标准


❌ D-10:Import AI 463: 自我改进机器人;一万卡中国 GPU 集群(Jack Clark · Substack)

丢弃理由: - 属于 newsletter 评论/随笔类,非具体工程内容 - "Self-improving robots" 无具体实现细节、命令或 benchmark - 一万卡集群是基础设施规模描述,无工程可复现性


❌ D-11:Import AI 462-460(Jack Clark · Substack)

丢弃理由: - 同上:随笔式 AI 评论,非工程实践 - "ASI 路径"、"AI 监督"属于战略/安全讨论,无工程细节


✅ G-07:usestrix/strix ⭐ 32,718(+2,137 today)

已覆盖于 afternoon 文件(G-01),但本次重新确认高优先级: - AI Security Agent 渗透测试工具 - 与 OWASP Top 10 Agents(ASI01-ASI10)实战对照 - 与 Agent-Native Immune System 安全框架呼应

✅ G-08:ECC(affaan-m/ECC)⭐ ~83k+

补充评估: - Skills / Instincts / Memory / Security 全栈 harness 优化 - 跨 Claude Code / Codex / Opencode / Cursor 多 harness 支持 - 差异化:ECC 定位"meta-tooling",解决"让已有 harness 更好"而非"造新模型" - 高 stars(83k+)表明社区认可度高

保留理由:Meta-tooling 定位独特,值得入知识库;需持续追踪 ECC 的 benchmark 数据


四、Hugging Face 部署命令补充保留

✅ H-06:vLLM Server on Hugging Face Jobs(HF Blog · 7天前)

补充评估: - 一行命令部署 vLLM Server 到 Hugging Face Jobs - 具体命令价值:适合快速验证 vLLM 部署,无需本地 GPU - 与 vLLM vs TRT-LLM vs SGLang benchmark 形成部署 + benchmark 完整闭环

保留理由:实操命令,与 inference engineering 主题页强关联


五、分类标签矩阵

标签 涉及条目
Agent-Memory R-12
Local-Coding-Agent R-11, R-14
Harness R-11, R-13, G-08
DSPy R-13
Prompt-Engineering R-13
Agent-Evaluation R-13
Scaling-Laws R-15
LLM-Training R-15
Coding-Agent R-14
Security-Agent G-07
Meta-Tooling G-08
Deployment H-06
Inference-Engineering R-15, H-06
Benchmark R-11

六、建议写入路径 & 后续行动

实际写入路径/shared/research-kb/inbox/jay/2026-07-03-engineering-filter-second-round.md

精读优先级排序: 1. R-13(DSPy GitHub repo)— 可复现 prompt engineering 案例 2. R-11(Local Coding Agent Stack)— 硬件需求 + Polar 论文 3. R-12(Memory Architecture)— 四层框架 + morning A-04 合并 4. R-15(Scaling Laws)— Lilian Weng 最新技术分析

主题页更新建议: - agent-memory 主题页:整合 R-12(四层架构)+ afternoon A-04(Continuum Memory),补充 Mem0/E2B/SuperMemory 对应位置 - agent-harness 主题页:整合 R-11(Qwen-Code 本地 stack)+ R-14(llm-coding-agent)+ G-08(ECC meta-tooling) - agent-evaluation 主题页:整合 R-13(DSPy)+ morning S-03(LLM-as-Judge 偏误)

GitHub 操作:无(按规则仅产出草稿)