知识库草稿 · Jay · 2026-08-01 10:50(第三次推送)

本次主题

工程实践二次筛选 · 第三轮(第三次推送)· 覆盖今日 RSS 新条目深度分析


筛选标准

重点保留符合以下任一条件的条目: - 真实环境、命令、错误处理、源码分析 - 性能数据、可复现步骤、benchmark 结果 - 来自 MSR/官方博客/顶级 engineer newsletter 的深度技术分析


一、高价值工程条目(保留)


条目 K1:ByteByteGo · How ChatGPT Optimizes its Agent Loop: Harness, API, and Inference ⭐⭐⭐⭐⭐

URL: https://blog.bytebytego.com/p/how-chatgpt-optimizes-its-agent-loop
来源: ByteByteGo(engineering-oriented tech newsletter)
时间: 2026-08-01(RSS,今日新)
标签: #Agent-Harness #Inference-Optimization #OpenAI #Codex #Architecture
可信度: 极高(OpenAI 工程师直接受访)
工程价值: ⭐⭐⭐⭐⭐

保留理由

核心架构:三层模型(harness → API → inference)

用户请求
  ↓
Harness 层(构建上下文 + 工具执行)
  ↓
API 层(认证、限速、tokenize、安全检查)
  ↓
Inference 层(GPU 推理、KV cache、speculative decoding)

具体技术细节(来自 OpenAI 工程师):

层次 优化技术 说明
Harness Persistent WebSockets 减少连接建立开销
Harness Stable prompt prefixes 缓存不变 prompt 前缀,避免重复 tokenize
Harness Deferred tool discovery 延迟工具发现,按需加载
Harness Code Mode 专用代码执行模式
API Tokenize only delta 仅对增量变化做 tokenize,而非全量
API Parallel safety checks 安全检查与推理并行化(race 机制)
Inference Cache-aware routing 根据 KV cache 热度路由请求
Inference KV cache management KV cache 生命周期管理
Inference Speculative decoding 投机解码加速生成
Inference Prefill/decode separation prefill 阶段与 decode 阶段解耦

Benchmark 数据: - GPT-5.6 Sol 在 Artificial Analysis Coding Agent Index 上得分高于 Fable 5,但 cost 不到 Fable 5 的一半 - 具体数值需参考原文,但方向性数据有工程参考价值

Agent Loop 具体执行流程示例: 1. Harness 接收任务("trace checkout regression, patch it, run tests") 2. Harness 组装指令 + 工具定义 + 历史记录 → 发往 API 3. API 做 JSON 验证、rate limit 检查、preflight 4. API tokenize 并 dispatch 到 inference,同时启动安全分类器 5. Inference 返回 tool call(如 search("checkout timeout")) 6. API decode token → 转为 API events → 流回 Harness 7. Harness 在沙箱执行搜索 → append 结果 → 循环

关键工程洞察:

"AI 应用 ≠ LLM。LLM 只是其中一层。真实产品中,用户请求在到达 LLM 之前已经过了 harness 层和 API 层的多次处理。"

后续行动:
- 精读原文完整技术细节(8000 char 截断,需读全文) - 评估自研 Agent 系统时是否需要引入 API 层做 tokenize 缓存和安全并行化 - Code Mode 细节值得重点关注


条目 K2:Import AI 466 · MirrorCode Benchmark(METR/Epoch)⭐⭐⭐⭐⭐

URL: https://importai.substack.com/p/import-ai-466-the-bitter-lesson-for
来源: Import AI(Jack Clark,AI research newsletter)
时间: 2026-08-01(RSS,今日新)
标签: #Coding-Agent #Benchmark #METR #Epoch #Long-horizon-Tasks
可信度: 极高(Epoch AI + METR 联合发布)
工程价值: ⭐⭐⭐⭐⭐

保留理由

Benchmark 设计(真实可复现): - MirrorCode:测试 AI 系统完成"人类需要数周"的编程任务的能力 - 25 个目标程序:pkl(Apple 的可编程配置语言,61k LOC)、gotree(系统发育树解析,16k LOC)、qsv_select(CSV 列选择,87k LOC)、ruff(Python linter/formatter) - 仅通过 CLI 访问目标程序源码(无源代码、无 web 访问),需要完整重新实现

具体性能数据:

模型 任务 耗时 推理成本 人类预估时间
Opus 4.7 gotree(多语言) $100–400 2–17 周
Opus 4.7 pkl(61k LOC) 2–17 周
GPT-5.5 gotree 2–17 周
Opus 4.7 ruff 未解决

关键数字: - Opus 4.7:14 小时完成,$251 推理成本 - 25 个目标中:17 个达到 100% 正确率;4 个达到 >99%;8 个未达到 100%;4 个未达到 99% - 1 年前的领先模型:得分约 30%,仅能完成简单程序(如 calendar utility)

代码仓库: - GitHub: github.com/epoch-research/MirrorCode - 包含 scaffold + 22/25 目标程序(132 个任务实例,6 种语言)

工程启示:

"AI 系统能自我定位(self-orient):仅通过黑盒 I/O 访问就能从零构建对标原程序的自研实现。这意味着高度智能的 Agent 可能具有从真实世界 bootstrapping 工业文明形态的能力。"

保留理由总结: - 有 GitHub 代码仓库(可复现) - 有具体 benchmark 程序(不是抽象评测) - 有具体成本数据($251,14 小时) - 有对比数据(1 年前 30% vs 现在)


条目 K3:Lilian Weng · Harness Engineering for Self-Improvement ⭐⭐⭐⭐⭐

URL: https://lilianweng.github.io/posts/2026-07-04-harness/
来源: Lil'Log(Lilian Weng,OpenAI 前安全工程负责人)
时间: 2026-07-04(RSS,今日新到)
标签: #Harness #RSI #Agent-Architecture #Self-Improvement #Framework
可信度: 极高(顶级 engineer 技术博客)
工程价值: ⭐⭐⭐⭐⭐

保留理由

核心框架:Harness = LLM + Memory + Tools + Planning + Action + Workflow Design + Eval + Permission Controls + Persistent State

三大 Harness 设计模式(均有工程细节):

Pattern 1: Workflow Automation(Karpathy autoresearch 为例) - Goal-oriented loop: plan → execute → observe/test → improve → loop - Karpathy autoresearch GitHub: github.com/karpathy/autoresearch - 关键:工作流图强调模型分析自身轨迹和失败案例,通过"agent runtime"而非静态 prompt 模板进行迭代

Pattern 2: File System as Persistent Memory - 长期 agent 任务中,artifacts(实验日志、代码 diff、论文摘要、错误 trace、rollout 轨迹)远大于 context window - 解决方案:用文件系统做持久化存储,而非全部塞入 context - 优势:利用模型本身读写文件的能力,管理成本随模型能力提升自动下降

Pattern 3: Sub-agent and Backend Jobs - 主 agent 并行 spawn 多个 subagent - 关键:并行性必须显式可检查(stored as files, logs, status records) - 主 agent 需要 process manager 能力:launch jobs, inspect logs, cancel failed runs, merge results

Coding Agent Harness 工具集(具体工具定义):

类别 工具
文件系统 glob, grep, ls, read, read_many, write, edit, multi_edit, apply_patch
Shell bash, PowerShell
IO lsp, git_status, git_diff, git_commit
外部上下文 MCP tools, Skills
Web web_search, web_fetch, browser tools
Artifacts Read docs/images, generate HTML/images
Backend CronCreate, CronDelete, CronList
Agent 委托 spawn_agent, resume_agent, wait_agent, list_agents, close_agent, interrupt_agent

Harness vs Core Intelligence(关键工程判断):

"近期 RSI 的实际路径不太可能是模型直接重写自身权重。更现实的路径:harness 工程进化为 meta-methodology(改进构建模型的机器),同时模型能力通过 pretraining 自然增长。"

保留理由总结: - 有具体工具列表(可复现) - 有 GitHub repo(Karpathy autoresearch) - 有系统化框架(3 patterns) - 深度技术分析,非表面介绍


条目 K4:Simon Willison · MCP 2.0 Stateless(深度分析)⭐⭐⭐⭐⭐

URL: https://simonwillison.net/2026/Jul/31/stateless-mcp/
来源: Simon Willison(top-tier engineer/developer advocate)
时间: 2026-07-31(RSS,今日新)
标签: #MCP #Protocol #Stateless #SDK #Anthropic
可信度: 极高(Simon Willison 亲验 + 源码)
工程价值: ⭐⭐⭐⭐⭐

保留理由

MCP 2.0 核心变更:stateful → stateless

Before(legacy stateful MCP): 两次 HTTP 请求

POST /mcp  # Step 1: initialize, 获取 Mcp-Session-Id
Mcp-Session-Id: 1868a90c-3a3f-4f5b
POST /mcp  # Step 2: 实际调用 tool

After(MCP 2.0 stateless): 单次 HTTP 请求

POST /mcp HTTP/1.1
MCP-Protocol-Version: 2026-07-28
Mcp-Method: tools/call
Mcp-Name: search
Content-Type: application/json
{"method": "tools/call", "params": {"name": "search", "arguments": {"q": "otters"}, "_meta": {"io.modelcontextprotocol/clientInfo": {"name": "my-app", "version": "1.0"}}}}

工程优势: 1. 客户端/服务端实现大幅简化 2. 适合构建可扩展 web 应用(无需 server-side session state) 3. 无需担心 session 路由到同一后端机器 4. 小模型(laptop 上运行的)也能良好驱动 MCP

具体可执行命令:

# 列出 MCP 服务器工具
uvx mcp-explorer list https://agentic-mermaid.dev/mcp

# 查看特定工具 schema
uvx mcp-explorer inspect render_svg

# 调用工具并传参
uvx mcp-explorer call \
  https://agentic-mermaid.dev/mcp \
  render_svg \
  -a source 'graph TD; A-->B' \
  -a options '{"padding":24}'

相关 GitHub 仓库: - mcp-explorer: github.com/simonw/mcp-explorer - datasette-mcp: github.com/simonw/datasette-mcp

关键工程洞察:

"给 Agent shell 环境 + internet 访问充满风险,且需要足够强的模型才能驾驭。MCP 工具更易于审计和控制,且足够简单,小模型也能良好驱动。"

保留理由总结: - 有具体 HTTP 请求格式对比(before/after) - 有可执行 uvx 命令 - 有 GitHub 源码仓库 - Simon Willison 亲自构建了 3 个实现,可信度高


条目 K5:Simon Willison · smevals Eval Framework ⭐⭐⭐⭐

URL: https://simonwillison.net/2026/Jul/31/smevals/
来源: Simon Willison + Prime Radiant
时间: 2026-07-31(RSS,今日新)
标签: #Eval #Harness #Framework #Agent #Testing
可信度: 高(Simon Willison + Prime Radiant 实验室)
工程价值: ⭐⭐⭐⭐

保留理由

smevals = small eval suite for evaluating models, prompts, and harnesses

核心概念(明确的术语体系): - Eval:一组 challenge,回答"某模型在 X 能力上表现如何" - Task:具体挑战,如"Generate an SVG of a pelican riding a bicycle" - Config:模型配置(含 model、system prompt、参数、harness) - Run:特定 config 执行特定 task 的记录 - Grader:评估 Run 结果,产生 Grade - Checker:检查逻辑(简单如字符串匹配,复杂如调用其他模型评判)

可执行命令:

# 让 coding agent 学习工具用法
uvx smevals docs

# 对多个模型运行 eval
uvx smevals run path-to-eval/ -m gpt-5.5 -m claude-opus-4.6

# 评分
uvx smevals grade path-to-eval/

# 本地探索结果
uvx smevals serve path-to-eval/

# 构建静态 HTML 报告
uvx smevals build path-to-eval/

GitHub 仓库: github.com/prime-radiant-inc/smevals

保留理由总结: - 有完整 CLI 命令(可复现) - 有 GitHub 代码 - 有明确的 eval 术语体系 - 与 Lilian Weng Harness Engineering 条目形成互补(eval 是 harness 工程的关键组件)


条目 K6:ByteByteGo · DoorDash/Instacart/Uber Eats LLM 搜索三种集成方式 ⭐⭐⭐⭐

URL: https://blog.bytebytego.com/p/why-doordash-instacart-and-uber-eats
来源: ByteByteGo
时间: 2026-08-01(RSS,今日新)
标签: #LLM-Integration #Search #Production #Architecture
可信度: 高(工程对比分析)
工程价值: ⭐⭐⭐⭐

保留理由

核心问题:LLM 应该多深地嵌入运行时?

三大失败模式(所有食品搜索平台的共性问题): 1. 同义词:Soda vs soft drink(keyword engine 视为不同 token) 2. 拼写错误:Mozzarela → mozzarella 3. 缩写:Gf pizza → gluten-free pizza 4. 语言混用:西班牙语 pan(面包)vs 英语 pan(平底锅) 5. 词义歧义:Apple(水果 vs 公司)

两个更难的问题: - 长尾问题:专业模型在罕见查询上表现差(罕见 = 按定义出现次数少) - 约束问题:"vegan chicken sandwich" 中 hard constraint(vegan)vs 相似度检索(可能返回含 chicken 但相似度高的结果)

三家集成方式(架构差异): - DoorDash:已有知识图谱,在其上构建 LLM 层 - Instacart:不同架构(具体方式待读全文) - Uber Eats:不同架构(具体方式待读全文)

关键洞察:

"基础设施的现状决定了 LLM 的集成深度。具体选择哪个模型是次要的。"

保留理由总结: - 三家实际生产系统对比,真实数据 - 有具体失败模式分类(可作工程 checklist) - 原文截断,需读全文获取三家具体架构


条目 K7:MSR · Echoverse:训练 Computer-Use Agent 的深度演进环境 ⭐⭐⭐⭐

URL: https://www.microsoft.com/en-us/research/blog/echoverse-deep-evolving-environments-for-computer-use-agents/
来源: Microsoft Research Blog
时间: 2026-08(RSS,今日新)
标签: #Computer-Use-Agent #Training #Simulation #MSR #RL
可信度: 极高(MSR 官方)
工程价值: ⭐⭐⭐⭐

保留理由

核心问题:computer-use agent 不能在真实环境(email、banking、医疗记录、云 console)中训练,因为每次尝试都会写到真实账户,且无法 reset。

解决方案:合成世界(Synthetic World) - 状态真实且可变,但可以安全破坏、快速 reset - 用数据而非截图来 grading

具体数据: - 构建了 12 个训练世界(10 个 deep domain worlds + 2 个 capability worlds) - Capability worlds 专门训练 date pickers 和 nested filters(agent 最常卡住的 UI 元素) - 训练在 12 个世界上,9B 模型:36.5% → 67.1%(几乎翻倍) - 与 GPT-5.4 差距缩小到 14 个百分点

关键工程发现: 1. High simulation fidelity is a must-have:浅层 world 导致模型 regression,深层 world 带来提升 2. Drilling challenging controls:在多种形式中专门训练 date pickers 和 nested filters,效果可泛化到未见 domain 3. Co-evolution:模型、世界、verifier 三者共同演进,互利提升 4. RL > Imitation:用 grounded verifier 做 reward,RL 超越 imitation learning

开源资产: - GitHub: github.com/microsoft/Echoverse(4 个世界开源) - Hugging Face: huggingface.co/datasets/microsoft/Echoverse - Technical Report: Microsoft Research(具体 URL 见原文)

保留理由总结: - 有开源代码和数据(Hugging Face) - 有具体 benchmark 数字 - 有 RL vs imitation 的工程对比结论


条目 K8:MSR · SymCrypt 中验证 Rust 密码学实现(从标准到代码)⭐⭐⭐⭐

URL: https://www.microsoft.com/en-us/research/blog/verifying-rust-cryptography-in-symcrypt-from-standards-to-code/
来源: Microsoft Research Blog
时间: 2026-08(RSS,今日新)
标签: #Cryptography #Rust #Formal-Verification #Lean #Security
可信度: 极高(MSR + SymCrypt 生产代码)
工程价值: ⭐⭐⭐⭐

保留理由

背景:SymCrypt 是 Microsoft 的开源密码学库,用于 Windows 和 Azure。

验证工具链:Rust + Lean + Aeneas - Rust:排除内存安全 bug 大类 - Lean:函数式证明框架 - Aeneas:验证 Rust 子集的自动化工具,提供 Lean 高效 automation

验证流程(具体步骤):

标准文档 → 形式化规范(Lean)→ Rust 实现 → Aeneas 验证 → Lean proof check

已验证代码(生产级别): - SHA-3(Rust 代码已在 Windows insider build 中使用) - ML-KEM(Rust 代码已在 Windows insider build 中使用) - 扩展中:AES-GCM、FrodoKEM、ML-DSA

AI Agent 在验证中的角色: - 人类:review 标准的形式化 + 主要 property - Agent(stochastic):写 proof 和中间 property - 确定性步骤(编译、代码提取、proof 验证):非 agentic

开源资产: - GitHub: github.com/microsoft/SymCrypt/tree/feature/verifiedcrypto(含正式 spec、proof、验证的 Rust 代码)

保留理由总结: - 真实生产代码(不是 toy example) - 有具体工具链(Rust + Lean + Aeneas) - 有开源代码仓库 - 对 AI+安全领域有工程参考价值


二、中等价值条目(条件保留)


条目 M1:Sebastian Raschka · LLM 架构最新进展(KV Sharing, mHC, Compressed Attention)⭐⭐⭐⭐

URL: https://magazine.sebastianraschka.com/p/recent-developments-in-llm-architectures
来源: Ahead of AI(RSS,今日新)
时间: 2026-07(RSS,今日新)
标签: #LLM-Architecture #KV-Cache #Attention #Gemma4 #DeepSeek-V4

条件保留理由: - Raschka 的架构分析有技术深度 - KV Sharing、mHC(multi-head cascade)、Compressed Attention 均是降低长上下文成本的具体技术 - 需读全文确认是否有足够工程细节

建议: 若时间允许可读;与 morning session 的 Kimi K3 KDA/AttnRes 可对照


条目 M2:Sebastian Raschka · 使用本地 Coding Agent(开源权重模型替代 Claude Code/Codex)⭐⭐⭐⭐

URL: https://magazine.sebastianraschka.com/p/using-local-coding-agents
来源: Ahead of AI(RSS,今日新)
时间: 2026-07(RSS,今日新)
标签: #Local-Coding-Agent #Open-Weight #Harness

条件保留理由: - 实用工程 workflow,与 morning session 的 copilot-sdk 可对照 - 提供 Claude Code/Codex 之外的替代方案 - 需读全文确认具体工具和命令


三、丢弃条目及理由

条目 来源 丢弃理由
Fireship YouTube(Anthropic 扼杀独立开发者、Kimi 2.8T) YouTube RSS 营销风格,非工程深度;视频内容无法文本索引
Karpathy YouTube(如何使用 LLMs、复现 GPT-2) YouTube RSS 已知内容(老课重复);非今日新
Import AI 466 其他内容(bitter lesson for robotics、Sunday ACT-2) Substack RSS 机器人/物理 AI 方向,与本知识库工程重点(LLM systems、RAG、Agent)相关性较低
Nathan Benaich(欧洲 AI 主权、Fund III) Substack RSS 地缘政治/投资方向,非工程实践
Cool Papers cs.IR(推荐系统 5 篇) papers.cool RSS 学术论文层,缺工程复现步骤;可归档但非高频关注
Cool Papers cs.CL(AskChem、多采样少反思等) papers.cool RSS 学术研究为主;ORCA-bench(oncall agent)有一定工程相关性但需进一步确认 benchmark 是否有开源代码

四、分类标签汇总

分类 条目
Agent Harness / Loop K1(ByteByteGo Agent Loop)、K3(Lilian Weng Harness Engineering)、K4(Simon Willison MCP 2.0)
Eval / Benchmark K2(MirrorCode)、K5(smevals)
Agent Training / Simulation K7(MSR Echoverse)
LLM Systems / Architecture K1(inference layer)、K6(DoorDash LLM search)、M1(KV sharing/compressed attention)
Security / Cryptography K8(MSR SymCrypt Rust verification)
Coding Agent K2(MirrorCode)、K5(smevals)、M2(Local coding agents)
Protocol / SDK K4(MCP 2.0 stateless)
Production Deployment K1(ByteByteGo)、K6(DoorDash/Instacart/Uber Eats)

五、建议写入路径

/shared/research-kb/inbox/jay/2026-08-01-1050-jay-engineering-filter.md

六、后续行动建议

优先级 行动 理由
极高 精读 K1 原文全文(ByteByteGo Agent Loop) OpenAI 工程师访谈,3 层架构具体技术细节,prefill/decode 分离等有直接工程参考价值
极高 跟进 K2 GitHub MirrorCode benchmark 完整 benchmark 代码 + 25 个目标程序,可直接复现
极高 跟进 K4 MCP 2.0 规范 + mcp-explorer 源码 重大协议变更,stateless 简化实现是趋势
精读 K3 原文全文(Lilian Weng Harness) RSI 框架 + 3 patterns,coding agent 工具集定义详细
跟进 K5 smevals GitHub + 实际试用 eval 是 harness 闭环关键组件,CLI 工具可直接试用
跟进 K7 Echoverse GitHub(4 个开源世界) 高仿真训练环境是 agent 能力突破的关键
读 K6 全文(DoorDash/Instacart/Uber Eats) 三家架构对比,工程选型参考
读 M1(Raschka LLM 架构)全文 对照 morning session Kimi K3 KDA/AttnRes
读 M2(Raschka Local Coding Agent)全文 与 morning session copilot-sdk 对照
K8 SymCrypt verification 代码浏览 生产级 Rust + formal verification,高门槛但有参考价值

七、主题页更新建议

主题页 建议更新内容
Agent 技术栈 新增 K1(三层架构)、K3(Harness Engineering 三 patterns)、K4(MCP 2.0 stateless)
Eval / Benchmark 新增 K2(MirrorCode)、K5(smevals),两个均有 GitHub 代码
Agent Training 新增 K7(Echoverse + RL vs imitation + Hugging Face 数据集)
LLM 架构 新增 M1(KV sharing, mHC, Compressed Attention)
安全/密码学 新增 K8(SymCrypt Rust + Lean + Aeneas 验证)

八、是否需要审稿 / 主题页更新

  • 需要审稿: K3(Lilian Weng Harness Engineering)原文深度足够,可单独成 topic page
  • 建议更新现有主题页: Agent 技术栈(K1/K3/K4)、Eval(Harness+MirrorCode+smevals)
  • 无需审稿: K2/K5 有 GitHub 代码可直接引用;K1/K4 原文已足够权威