知识库草稿 · Jay · 2026-08-01 10:50(第三次推送)
本次主题
工程实践二次筛选 · 第三轮(第三次推送)· 覆盖今日 RSS 新条目深度分析
筛选标准
重点保留符合以下任一条件的条目: - 真实环境、命令、错误处理、源码分析 - 性能数据、可复现步骤、benchmark 结果 - 来自 MSR/官方博客/顶级 engineer newsletter 的深度技术分析
一、高价值工程条目(保留)
条目 K1:ByteByteGo · How ChatGPT Optimizes its Agent Loop: Harness, API, and Inference ⭐⭐⭐⭐⭐
URL: https://blog.bytebytego.com/p/how-chatgpt-optimizes-its-agent-loop
来源: ByteByteGo(engineering-oriented tech newsletter)
时间: 2026-08-01(RSS,今日新)
标签: #Agent-Harness #Inference-Optimization #OpenAI #Codex #Architecture
可信度: 极高(OpenAI 工程师直接受访)
工程价值: ⭐⭐⭐⭐⭐
保留理由
核心架构:三层模型(harness → API → inference)
用户请求
↓
Harness 层(构建上下文 + 工具执行)
↓
API 层(认证、限速、tokenize、安全检查)
↓
Inference 层(GPU 推理、KV cache、speculative decoding)
具体技术细节(来自 OpenAI 工程师):
| 层次 | 优化技术 | 说明 |
|---|---|---|
| Harness | Persistent WebSockets | 减少连接建立开销 |
| Harness | Stable prompt prefixes | 缓存不变 prompt 前缀,避免重复 tokenize |
| Harness | Deferred tool discovery | 延迟工具发现,按需加载 |
| Harness | Code Mode | 专用代码执行模式 |
| API | Tokenize only delta | 仅对增量变化做 tokenize,而非全量 |
| API | Parallel safety checks | 安全检查与推理并行化(race 机制) |
| Inference | Cache-aware routing | 根据 KV cache 热度路由请求 |
| Inference | KV cache management | KV cache 生命周期管理 |
| Inference | Speculative decoding | 投机解码加速生成 |
| Inference | Prefill/decode separation | prefill 阶段与 decode 阶段解耦 |
Benchmark 数据: - GPT-5.6 Sol 在 Artificial Analysis Coding Agent Index 上得分高于 Fable 5,但 cost 不到 Fable 5 的一半 - 具体数值需参考原文,但方向性数据有工程参考价值
Agent Loop 具体执行流程示例:
1. Harness 接收任务("trace checkout regression, patch it, run tests")
2. Harness 组装指令 + 工具定义 + 历史记录 → 发往 API
3. API 做 JSON 验证、rate limit 检查、preflight
4. API tokenize 并 dispatch 到 inference,同时启动安全分类器
5. Inference 返回 tool call(如 search("checkout timeout"))
6. API decode token → 转为 API events → 流回 Harness
7. Harness 在沙箱执行搜索 → append 结果 → 循环
关键工程洞察:
"AI 应用 ≠ LLM。LLM 只是其中一层。真实产品中,用户请求在到达 LLM 之前已经过了 harness 层和 API 层的多次处理。"
后续行动:
- 精读原文完整技术细节(8000 char 截断,需读全文)
- 评估自研 Agent 系统时是否需要引入 API 层做 tokenize 缓存和安全并行化
- Code Mode 细节值得重点关注
条目 K2:Import AI 466 · MirrorCode Benchmark(METR/Epoch)⭐⭐⭐⭐⭐
URL: https://importai.substack.com/p/import-ai-466-the-bitter-lesson-for
来源: Import AI(Jack Clark,AI research newsletter)
时间: 2026-08-01(RSS,今日新)
标签: #Coding-Agent #Benchmark #METR #Epoch #Long-horizon-Tasks
可信度: 极高(Epoch AI + METR 联合发布)
工程价值: ⭐⭐⭐⭐⭐
保留理由
Benchmark 设计(真实可复现): - MirrorCode:测试 AI 系统完成"人类需要数周"的编程任务的能力 - 25 个目标程序:pkl(Apple 的可编程配置语言,61k LOC)、gotree(系统发育树解析,16k LOC)、qsv_select(CSV 列选择,87k LOC)、ruff(Python linter/formatter) - 仅通过 CLI 访问目标程序源码(无源代码、无 web 访问),需要完整重新实现
具体性能数据:
| 模型 | 任务 | 耗时 | 推理成本 | 人类预估时间 |
|---|---|---|---|---|
| Opus 4.7 | gotree(多语言) | — | $100–400 | 2–17 周 |
| Opus 4.7 | pkl(61k LOC) | — | — | 2–17 周 |
| GPT-5.5 | gotree | — | — | 2–17 周 |
| Opus 4.7 | ruff | 未解决 | — | — |
关键数字: - Opus 4.7:14 小时完成,$251 推理成本 - 25 个目标中:17 个达到 100% 正确率;4 个达到 >99%;8 个未达到 100%;4 个未达到 99% - 1 年前的领先模型:得分约 30%,仅能完成简单程序(如 calendar utility)
代码仓库: - GitHub: github.com/epoch-research/MirrorCode - 包含 scaffold + 22/25 目标程序(132 个任务实例,6 种语言)
工程启示:
"AI 系统能自我定位(self-orient):仅通过黑盒 I/O 访问就能从零构建对标原程序的自研实现。这意味着高度智能的 Agent 可能具有从真实世界 bootstrapping 工业文明形态的能力。"
保留理由总结: - 有 GitHub 代码仓库(可复现) - 有具体 benchmark 程序(不是抽象评测) - 有具体成本数据($251,14 小时) - 有对比数据(1 年前 30% vs 现在)
条目 K3:Lilian Weng · Harness Engineering for Self-Improvement ⭐⭐⭐⭐⭐
URL: https://lilianweng.github.io/posts/2026-07-04-harness/
来源: Lil'Log(Lilian Weng,OpenAI 前安全工程负责人)
时间: 2026-07-04(RSS,今日新到)
标签: #Harness #RSI #Agent-Architecture #Self-Improvement #Framework
可信度: 极高(顶级 engineer 技术博客)
工程价值: ⭐⭐⭐⭐⭐
保留理由
核心框架:Harness = LLM + Memory + Tools + Planning + Action + Workflow Design + Eval + Permission Controls + Persistent State
三大 Harness 设计模式(均有工程细节):
Pattern 1: Workflow Automation(Karpathy autoresearch 为例) - Goal-oriented loop: plan → execute → observe/test → improve → loop - Karpathy autoresearch GitHub: github.com/karpathy/autoresearch - 关键:工作流图强调模型分析自身轨迹和失败案例,通过"agent runtime"而非静态 prompt 模板进行迭代
Pattern 2: File System as Persistent Memory - 长期 agent 任务中,artifacts(实验日志、代码 diff、论文摘要、错误 trace、rollout 轨迹)远大于 context window - 解决方案:用文件系统做持久化存储,而非全部塞入 context - 优势:利用模型本身读写文件的能力,管理成本随模型能力提升自动下降
Pattern 3: Sub-agent and Backend Jobs - 主 agent 并行 spawn 多个 subagent - 关键:并行性必须显式可检查(stored as files, logs, status records) - 主 agent 需要 process manager 能力:launch jobs, inspect logs, cancel failed runs, merge results
Coding Agent Harness 工具集(具体工具定义):
| 类别 | 工具 |
|---|---|
| 文件系统 | glob, grep, ls, read, read_many, write, edit, multi_edit, apply_patch |
| Shell | bash, PowerShell |
| IO | lsp, git_status, git_diff, git_commit |
| 外部上下文 | MCP tools, Skills |
| Web | web_search, web_fetch, browser tools |
| Artifacts | Read docs/images, generate HTML/images |
| Backend | CronCreate, CronDelete, CronList |
| Agent 委托 | spawn_agent, resume_agent, wait_agent, list_agents, close_agent, interrupt_agent |
Harness vs Core Intelligence(关键工程判断):
"近期 RSI 的实际路径不太可能是模型直接重写自身权重。更现实的路径:harness 工程进化为 meta-methodology(改进构建模型的机器),同时模型能力通过 pretraining 自然增长。"
保留理由总结: - 有具体工具列表(可复现) - 有 GitHub repo(Karpathy autoresearch) - 有系统化框架(3 patterns) - 深度技术分析,非表面介绍
条目 K4:Simon Willison · MCP 2.0 Stateless(深度分析)⭐⭐⭐⭐⭐
URL: https://simonwillison.net/2026/Jul/31/stateless-mcp/
来源: Simon Willison(top-tier engineer/developer advocate)
时间: 2026-07-31(RSS,今日新)
标签: #MCP #Protocol #Stateless #SDK #Anthropic
可信度: 极高(Simon Willison 亲验 + 源码)
工程价值: ⭐⭐⭐⭐⭐
保留理由
MCP 2.0 核心变更:stateful → stateless
Before(legacy stateful MCP): 两次 HTTP 请求
POST /mcp # Step 1: initialize, 获取 Mcp-Session-Id
Mcp-Session-Id: 1868a90c-3a3f-4f5b
POST /mcp # Step 2: 实际调用 tool
After(MCP 2.0 stateless): 单次 HTTP 请求
POST /mcp HTTP/1.1
MCP-Protocol-Version: 2026-07-28
Mcp-Method: tools/call
Mcp-Name: search
Content-Type: application/json
{"method": "tools/call", "params": {"name": "search", "arguments": {"q": "otters"}, "_meta": {"io.modelcontextprotocol/clientInfo": {"name": "my-app", "version": "1.0"}}}}
工程优势: 1. 客户端/服务端实现大幅简化 2. 适合构建可扩展 web 应用(无需 server-side session state) 3. 无需担心 session 路由到同一后端机器 4. 小模型(laptop 上运行的)也能良好驱动 MCP
具体可执行命令:
# 列出 MCP 服务器工具
uvx mcp-explorer list https://agentic-mermaid.dev/mcp
# 查看特定工具 schema
uvx mcp-explorer inspect render_svg
# 调用工具并传参
uvx mcp-explorer call \
https://agentic-mermaid.dev/mcp \
render_svg \
-a source 'graph TD; A-->B' \
-a options '{"padding":24}'
相关 GitHub 仓库: - mcp-explorer: github.com/simonw/mcp-explorer - datasette-mcp: github.com/simonw/datasette-mcp
关键工程洞察:
"给 Agent shell 环境 + internet 访问充满风险,且需要足够强的模型才能驾驭。MCP 工具更易于审计和控制,且足够简单,小模型也能良好驱动。"
保留理由总结: - 有具体 HTTP 请求格式对比(before/after) - 有可执行 uvx 命令 - 有 GitHub 源码仓库 - Simon Willison 亲自构建了 3 个实现,可信度高
条目 K5:Simon Willison · smevals Eval Framework ⭐⭐⭐⭐
URL: https://simonwillison.net/2026/Jul/31/smevals/
来源: Simon Willison + Prime Radiant
时间: 2026-07-31(RSS,今日新)
标签: #Eval #Harness #Framework #Agent #Testing
可信度: 高(Simon Willison + Prime Radiant 实验室)
工程价值: ⭐⭐⭐⭐
保留理由
smevals = small eval suite for evaluating models, prompts, and harnesses
核心概念(明确的术语体系): - Eval:一组 challenge,回答"某模型在 X 能力上表现如何" - Task:具体挑战,如"Generate an SVG of a pelican riding a bicycle" - Config:模型配置(含 model、system prompt、参数、harness) - Run:特定 config 执行特定 task 的记录 - Grader:评估 Run 结果,产生 Grade - Checker:检查逻辑(简单如字符串匹配,复杂如调用其他模型评判)
可执行命令:
# 让 coding agent 学习工具用法
uvx smevals docs
# 对多个模型运行 eval
uvx smevals run path-to-eval/ -m gpt-5.5 -m claude-opus-4.6
# 评分
uvx smevals grade path-to-eval/
# 本地探索结果
uvx smevals serve path-to-eval/
# 构建静态 HTML 报告
uvx smevals build path-to-eval/
GitHub 仓库: github.com/prime-radiant-inc/smevals
保留理由总结: - 有完整 CLI 命令(可复现) - 有 GitHub 代码 - 有明确的 eval 术语体系 - 与 Lilian Weng Harness Engineering 条目形成互补(eval 是 harness 工程的关键组件)
条目 K6:ByteByteGo · DoorDash/Instacart/Uber Eats LLM 搜索三种集成方式 ⭐⭐⭐⭐
URL: https://blog.bytebytego.com/p/why-doordash-instacart-and-uber-eats
来源: ByteByteGo
时间: 2026-08-01(RSS,今日新)
标签: #LLM-Integration #Search #Production #Architecture
可信度: 高(工程对比分析)
工程价值: ⭐⭐⭐⭐
保留理由
核心问题:LLM 应该多深地嵌入运行时?
三大失败模式(所有食品搜索平台的共性问题): 1. 同义词:Soda vs soft drink(keyword engine 视为不同 token) 2. 拼写错误:Mozzarela → mozzarella 3. 缩写:Gf pizza → gluten-free pizza 4. 语言混用:西班牙语 pan(面包)vs 英语 pan(平底锅) 5. 词义歧义:Apple(水果 vs 公司)
两个更难的问题: - 长尾问题:专业模型在罕见查询上表现差(罕见 = 按定义出现次数少) - 约束问题:"vegan chicken sandwich" 中 hard constraint(vegan)vs 相似度检索(可能返回含 chicken 但相似度高的结果)
三家集成方式(架构差异): - DoorDash:已有知识图谱,在其上构建 LLM 层 - Instacart:不同架构(具体方式待读全文) - Uber Eats:不同架构(具体方式待读全文)
关键洞察:
"基础设施的现状决定了 LLM 的集成深度。具体选择哪个模型是次要的。"
保留理由总结: - 三家实际生产系统对比,真实数据 - 有具体失败模式分类(可作工程 checklist) - 原文截断,需读全文获取三家具体架构
条目 K7:MSR · Echoverse:训练 Computer-Use Agent 的深度演进环境 ⭐⭐⭐⭐
URL: https://www.microsoft.com/en-us/research/blog/echoverse-deep-evolving-environments-for-computer-use-agents/
来源: Microsoft Research Blog
时间: 2026-08(RSS,今日新)
标签: #Computer-Use-Agent #Training #Simulation #MSR #RL
可信度: 极高(MSR 官方)
工程价值: ⭐⭐⭐⭐
保留理由
核心问题:computer-use agent 不能在真实环境(email、banking、医疗记录、云 console)中训练,因为每次尝试都会写到真实账户,且无法 reset。
解决方案:合成世界(Synthetic World) - 状态真实且可变,但可以安全破坏、快速 reset - 用数据而非截图来 grading
具体数据: - 构建了 12 个训练世界(10 个 deep domain worlds + 2 个 capability worlds) - Capability worlds 专门训练 date pickers 和 nested filters(agent 最常卡住的 UI 元素) - 训练在 12 个世界上,9B 模型:36.5% → 67.1%(几乎翻倍) - 与 GPT-5.4 差距缩小到 14 个百分点
关键工程发现: 1. High simulation fidelity is a must-have:浅层 world 导致模型 regression,深层 world 带来提升 2. Drilling challenging controls:在多种形式中专门训练 date pickers 和 nested filters,效果可泛化到未见 domain 3. Co-evolution:模型、世界、verifier 三者共同演进,互利提升 4. RL > Imitation:用 grounded verifier 做 reward,RL 超越 imitation learning
开源资产: - GitHub: github.com/microsoft/Echoverse(4 个世界开源) - Hugging Face: huggingface.co/datasets/microsoft/Echoverse - Technical Report: Microsoft Research(具体 URL 见原文)
保留理由总结: - 有开源代码和数据(Hugging Face) - 有具体 benchmark 数字 - 有 RL vs imitation 的工程对比结论
条目 K8:MSR · SymCrypt 中验证 Rust 密码学实现(从标准到代码)⭐⭐⭐⭐
URL: https://www.microsoft.com/en-us/research/blog/verifying-rust-cryptography-in-symcrypt-from-standards-to-code/
来源: Microsoft Research Blog
时间: 2026-08(RSS,今日新)
标签: #Cryptography #Rust #Formal-Verification #Lean #Security
可信度: 极高(MSR + SymCrypt 生产代码)
工程价值: ⭐⭐⭐⭐
保留理由
背景:SymCrypt 是 Microsoft 的开源密码学库,用于 Windows 和 Azure。
验证工具链:Rust + Lean + Aeneas - Rust:排除内存安全 bug 大类 - Lean:函数式证明框架 - Aeneas:验证 Rust 子集的自动化工具,提供 Lean 高效 automation
验证流程(具体步骤):
标准文档 → 形式化规范(Lean)→ Rust 实现 → Aeneas 验证 → Lean proof check
已验证代码(生产级别): - SHA-3(Rust 代码已在 Windows insider build 中使用) - ML-KEM(Rust 代码已在 Windows insider build 中使用) - 扩展中:AES-GCM、FrodoKEM、ML-DSA
AI Agent 在验证中的角色: - 人类:review 标准的形式化 + 主要 property - Agent(stochastic):写 proof 和中间 property - 确定性步骤(编译、代码提取、proof 验证):非 agentic
开源资产: - GitHub: github.com/microsoft/SymCrypt/tree/feature/verifiedcrypto(含正式 spec、proof、验证的 Rust 代码)
保留理由总结: - 真实生产代码(不是 toy example) - 有具体工具链(Rust + Lean + Aeneas) - 有开源代码仓库 - 对 AI+安全领域有工程参考价值
二、中等价值条目(条件保留)
条目 M1:Sebastian Raschka · LLM 架构最新进展(KV Sharing, mHC, Compressed Attention)⭐⭐⭐⭐
URL: https://magazine.sebastianraschka.com/p/recent-developments-in-llm-architectures
来源: Ahead of AI(RSS,今日新)
时间: 2026-07(RSS,今日新)
标签: #LLM-Architecture #KV-Cache #Attention #Gemma4 #DeepSeek-V4
条件保留理由: - Raschka 的架构分析有技术深度 - KV Sharing、mHC(multi-head cascade)、Compressed Attention 均是降低长上下文成本的具体技术 - 需读全文确认是否有足够工程细节
建议: 若时间允许可读;与 morning session 的 Kimi K3 KDA/AttnRes 可对照
条目 M2:Sebastian Raschka · 使用本地 Coding Agent(开源权重模型替代 Claude Code/Codex)⭐⭐⭐⭐
URL: https://magazine.sebastianraschka.com/p/using-local-coding-agents
来源: Ahead of AI(RSS,今日新)
时间: 2026-07(RSS,今日新)
标签: #Local-Coding-Agent #Open-Weight #Harness
条件保留理由: - 实用工程 workflow,与 morning session 的 copilot-sdk 可对照 - 提供 Claude Code/Codex 之外的替代方案 - 需读全文确认具体工具和命令
三、丢弃条目及理由
| 条目 | 来源 | 丢弃理由 |
|---|---|---|
| Fireship YouTube(Anthropic 扼杀独立开发者、Kimi 2.8T) | YouTube RSS | 营销风格,非工程深度;视频内容无法文本索引 |
| Karpathy YouTube(如何使用 LLMs、复现 GPT-2) | YouTube RSS | 已知内容(老课重复);非今日新 |
| Import AI 466 其他内容(bitter lesson for robotics、Sunday ACT-2) | Substack RSS | 机器人/物理 AI 方向,与本知识库工程重点(LLM systems、RAG、Agent)相关性较低 |
| Nathan Benaich(欧洲 AI 主权、Fund III) | Substack RSS | 地缘政治/投资方向,非工程实践 |
| Cool Papers cs.IR(推荐系统 5 篇) | papers.cool RSS | 学术论文层,缺工程复现步骤;可归档但非高频关注 |
| Cool Papers cs.CL(AskChem、多采样少反思等) | papers.cool RSS | 学术研究为主;ORCA-bench(oncall agent)有一定工程相关性但需进一步确认 benchmark 是否有开源代码 |
四、分类标签汇总
| 分类 | 条目 |
|---|---|
| Agent Harness / Loop | K1(ByteByteGo Agent Loop)、K3(Lilian Weng Harness Engineering)、K4(Simon Willison MCP 2.0) |
| Eval / Benchmark | K2(MirrorCode)、K5(smevals) |
| Agent Training / Simulation | K7(MSR Echoverse) |
| LLM Systems / Architecture | K1(inference layer)、K6(DoorDash LLM search)、M1(KV sharing/compressed attention) |
| Security / Cryptography | K8(MSR SymCrypt Rust verification) |
| Coding Agent | K2(MirrorCode)、K5(smevals)、M2(Local coding agents) |
| Protocol / SDK | K4(MCP 2.0 stateless) |
| Production Deployment | K1(ByteByteGo)、K6(DoorDash/Instacart/Uber Eats) |
五、建议写入路径
/shared/research-kb/inbox/jay/2026-08-01-1050-jay-engineering-filter.md
六、后续行动建议
| 优先级 | 行动 | 理由 |
|---|---|---|
| 极高 | 精读 K1 原文全文(ByteByteGo Agent Loop) | OpenAI 工程师访谈,3 层架构具体技术细节,prefill/decode 分离等有直接工程参考价值 |
| 极高 | 跟进 K2 GitHub MirrorCode benchmark | 完整 benchmark 代码 + 25 个目标程序,可直接复现 |
| 极高 | 跟进 K4 MCP 2.0 规范 + mcp-explorer 源码 | 重大协议变更,stateless 简化实现是趋势 |
| 高 | 精读 K3 原文全文(Lilian Weng Harness) | RSI 框架 + 3 patterns,coding agent 工具集定义详细 |
| 高 | 跟进 K5 smevals GitHub + 实际试用 | eval 是 harness 闭环关键组件,CLI 工具可直接试用 |
| 高 | 跟进 K7 Echoverse GitHub(4 个开源世界) | 高仿真训练环境是 agent 能力突破的关键 |
| 中 | 读 K6 全文(DoorDash/Instacart/Uber Eats) | 三家架构对比,工程选型参考 |
| 中 | 读 M1(Raschka LLM 架构)全文 | 对照 morning session Kimi K3 KDA/AttnRes |
| 中 | 读 M2(Raschka Local Coding Agent)全文 | 与 morning session copilot-sdk 对照 |
| 低 | K8 SymCrypt verification 代码浏览 | 生产级 Rust + formal verification,高门槛但有参考价值 |
七、主题页更新建议
| 主题页 | 建议更新内容 |
|---|---|
| Agent 技术栈 | 新增 K1(三层架构)、K3(Harness Engineering 三 patterns)、K4(MCP 2.0 stateless) |
| Eval / Benchmark | 新增 K2(MirrorCode)、K5(smevals),两个均有 GitHub 代码 |
| Agent Training | 新增 K7(Echoverse + RL vs imitation + Hugging Face 数据集) |
| LLM 架构 | 新增 M1(KV sharing, mHC, Compressed Attention) |
| 安全/密码学 | 新增 K8(SymCrypt Rust + Lean + Aeneas 验证) |
八、是否需要审稿 / 主题页更新
- 需要审稿: K3(Lilian Weng Harness Engineering)原文深度足够,可单独成 topic page
- 建议更新现有主题页: Agent 技术栈(K1/K3/K4)、Eval(Harness+MirrorCode+smevals)
- 无需审稿: K2/K5 有 GitHub 代码可直接引用;K1/K4 原文已足够权威