coding-agents · 知识库活文档
-
更新:v41 morning(Anthropic 9 篇 + SkillSentry/AgentExecutor 三联 + 反方升第 3 例 + 8-19 实测)
-
:编码智能体(coding agents / agent harness / SWE-bench 系评测 / 软件工程自动化 / 安全 + IDE 集成)SOTA 综述。
一、现状全景(2026-08 H1 视角 · Wave4 E1 第四十一棒 · 8-25 22:45 → 8-27 10:00 35h 跨周末窗口)
承接 v40 = v41 承接。8-25 22:45 → 8-27 10:00 35h 跨周末窗口 = 0 件 coding-agents 主轴净增(饱和延展期第 18 日延续 · 5 实例 30+ 文件 ≥ 2/3 主棒零落盘跨周末协同断档风险观察 · 但 v40 evening 棒已饱和落地无新增主轴需求)+ 14 件邻接级延展(① ★★★ Anthropic Engineering 9 篇 harness 设计实证 8-26 morning 棒集中捕获 = harness engineering 跨厂商实证第二栖「Anthropic 路线」+ ② ★★★ SkillSentry arXiv:2608.09253 2026-08-10 = 技能导向运行时保障 = harness engineering 自演进路线第四件 + ③ ★★★ AgentExecutor arXiv:2608.05959 ASE'26 顶会论文 = partial code execution + prefix tree 引导 = harness engineering 自演进路线第五件 + ④ ★★ Recoverable Execution arXiv:2608.14380 2026-08 = 长程 Agent 可恢复执行 = harness fault-tolerance 立基础延展预备 + ⑤ ★ Externalization in LLM Agents arXiv:2604.08224 = Codex-style cloud sandbox vs Claude Code graduated permission modes = sandbox / permission engineering 立基础延展预备 + ⑥ ★ aishwaryasrinivasan harness Substack = Mitchell Hashimoto「Agent = Model + Harness」公式三层 harness 框架 = harness methodology 立基础延展预备 + ⑦ ★ LLM4SE+Security Survey arXiv:2608.21107 = 三维分类法 = LLM4SE 综述方法论补充 + ⑧ ★★ Agent Gym arXiv:2608.15591 8-25 Google = 宪法层 YAML/Markdown 规则书 + 运行时修正引擎 ALF + Spec-to-Note Gap = Agent 行为修正范式立基础延展预备 + ⑨ ★ MemoryArena 反直觉发现 long context > 专用 Memory Agent = 2026 H2 记忆系统反方证据群升第 3 例预备 = 与 MemTrapBench/Reliability Science/StateMemBench/BASM/ReFind/ReCache 6 件跨学科证据群整合 = 7 件集中爆发 + ⑩ ★ Netflix vLLM+Triton serving 案例 = production LLM serving 工程决策 = 邻接级产业延展预备 + ⑪ ★ Anthropic Claude Code auto mode 2026-04-08 + Scaling Managed Agents Decoupling the brain from the hands 2026-04-23 = harness permission / managed agent 治理实证 + ⑫ ★ SWE-bench Verified 8-19 leaderboard 实测 = Opus 5 96% / Mythos 5 95.5% / Fable 5 95% + Terminal-Bench 2.1 = GPT-5.6 Sol 89.5% + Opus 5 89.1% + GLM-5.2 80% + Kimi K2.5 76.8% + MiniMax M2.5 80.2% = 模型与基座主权开源栖三联立标层 2026-08-19 实测 + ⑬ ★ Addy Osmani My LLM Coding Workflow 沿用补强(已 v37 沿用) + ⑭ ★ Datadog 5% LLM 调用报错 60% rate limit 容量天花板沿用补强(v40 已入档))= 14 件邻接级延展 + 1 件 P0 #8 v40 完全闭环确认 = 15 件**。
核心增量(v41 8-25 22:45 → 8-27 10:00 35h 跨周末窗口 · 14 条压缩列表):
- ① ★★★ Anthropic Engineering 9 篇 harness 设计实证 8-26 morning 棒集中捕获 = harness engineering 跨厂商实证第二栖「Anthropic 路线」立基础延展预备(jay 8-26 1950 engineering-secondary-filter · 1+2+4+5+7+8+9+10+11 集中捕获 + anthologic.com/engineering 页 9 篇目 = aishwaryasrinivasan Substack「Agent = Model + Harness」公式 + nyosegawa harness engineering best practices 2026-03-26 + Fareed Khan Building Claude Code with Harness Engineering early 2026 三件互补互证 = harness engineering 实证跨厂商学术化首次系统化预备 = 「Effective harnesses for long-running agents」2025-11-26 + 「Harness design for long-running application development」2026-03-24 + 「Scaling Managed Agents: Decoupling the brain from the hands」2026-04-23 + 「How we built Claude Code auto mode: a safer way to skip permissions」2026-04-08 + 「Quantifying infrastructure noise in agentic coding evals」2026-02-05 + 「Building a C compiler with a team of parallel Claudes」2026-02-05 + 「Eval awareness in Claude Opus 4.6's BrowseComp performance」2026-03-06 + 「Demystifying evals for AI agents」2026-01-09 + 「Designing AI-resistant technical evaluations」2026-01-21 = 9 篇 harness engineering 实证体系)
- ② ★★★ SkillSentry arXiv:2608.09253 2026-08-10 = 技能导向运行时保障 = harness engineering 自演进路线第四件 = jay 8-26 1950 engineering-secondary-filter #3 · 实验评估 + runtime overhead 数据 · 引用 Anthropic Claude Code Hooks、OpenAI Codex Hooks 具体集成细节 = harness engineering 自演进路线「harness 自身可观测性 + 故障兜底」立基础延展预备(与 Microsoft post-training harness 2608.17528 + Self-Harness 2606.09498 + HarnessOpt-Bench 2608.0606 构成"harness engineering 自演进路线四联")
- ③ ★★★ AgentExecutor arXiv:2608.05959 ASE'26 顶会论文 = partial code execution + prefix tree 引导 = harness engineering 自演进路线第五件 = jay 8-26 1950 engineering-secondary-filter #4 · Partial code execution 每次约 $0.055(与 Treefix 对比)· Efficiency results Table 3 monetary cost、code coverage 具体指标 · Prompt caching 价格差异具体提及 = harness engineering 自演进路线「partial execution 经济性 + prefix tree 引导代码理解」立基础延展预备 = 与 ②④⑤ 构成完整"harness engineering 自演进路线五联"
- ④ ★★ Recoverable Execution arXiv:2608.14380 2026-08 = 长程 Agent 可恢复执行 = harness fault-tolerance 立基础延展预备 = jay 8-26 1950 engineering-secondary-filter #5 · 三种执行策略对比 = Continue / Restart with Experiences / Safety Review · AgentDoG guardrail 具体机制 = local monitor model、safe/unsafe 二值判断 · 确定性信号 = action 是否在允许路径内、命令类别(read-only、workspace-local test)· GPT-5.4 / GPT-5.4 mini 具体模型对比实验 = harness fault-tolerance 工程立基础延展预备(与 Recoverable Execution for Long-Horizon Agents 主题直接命中)
- ⑤ ★ Externalization in LLM Agents arXiv:2604.08224 = Codex-style cloud sandbox vs Claude Code graduated permission modes = sandbox / permission engineering 立基础延展预备 = jay 8-26 1950 engineering-secondary-filter #10 · Codex 沙箱属性 = dedicated cloud sandbox、filesystem snapshot、network restrictions、resource quotas · 外部化技能机制 = load、reuse、compose across tasks · OpenTelemetry tracing 集成到 agent harness 的具体说明 = sandbox / permission / externalization 三角立基础延展预备
- ⑥ ★ aishwaryasrinivasan harness Substack = Mitchell Hashimoto「Agent = Model + Harness」公式三层 harness 框架 = jay 8-26 1950 engineering-secondary-filter #8 · Mitchell Hashimoto 2026 年「Agent = Model + Harness」公式 · 三层 Harness = Context & Orchestration / Tools & Permissions & Governance / Evaluation & Observability & Feedback Loop · "Only 5% enterprise agents reach production" 行业统计 · Frozen-Model Mindset = making failures structurally impossible · Practical starting checklist = harness methodology 立基础延展预备
- ⑦ ★ LLM4SE+Security Survey arXiv:2608.21107 = 三维分类法 = LLM4SE 综述方法论补充 = jay 8-26 1950 engineering-secondary-filter #9 · 三维分类法 = SE 任务 × 安全任务 × 适应机制 · 任务覆盖 = code generation、automated repair、software testing、vulnerability detection、malware analysis · assurance framework 分离 functional correctness 和 security · 截至 2026-05-31 文献调研
- ⑧ ★★ Agent Gym arXiv:2608.15591 8-25 Google = 宪法层 YAML/Markdown 规则书 + 运行时修正引擎 ALF + Spec-to-Note Gap = Agent 行为修正范式立基础延展预备 = jay 8-27 0820 csdn-substack-highvalue-rag-agent-mcp-aug27 · 三层调查架构降低 LLM 调用成本 · 程序化安全循环防止新规则副作用 = Agent 行为修正范式立基础延展预备(与 ②③⑤⑥⑦ 整合 = harness engineering 自演进路线六联预备)
- ⑨ ★★ MemoryArena 反直觉发现 long context > 专用 Memory Agent = 2026 H2 记忆系统反方证据群升第 3 例预备 = jay 8-22 1450 engineering-filter-pm #5 · 反直觉发现 = 简单 long context(直接塞入 prompt)在 end-to-end 任务完成速度上反而最快 · 专用 Memory Agent(如 Lettera、megraph)latency 显著更高,但 success rate 并不更好 · "你为复杂 memory 系统支付了大量时间税,但系统实际上可能让你的 agent 表现更差" · YouTube Feb 2026 引用 arXiv 论文 = 与 MemTrapBench 2608.20202 + Reliability Science Framework 2603.29231 + StateMemBench 2608.19652 + BASM 2608.22339 + ReFind 2608.12888 + ReCache 2608.19662 = 2026 H2 记忆系统反方证据群从 6 件升为 7 件 = 反方立基础延革预备从 v40 第 2 例升为 v41 第 3 例 ★★★★
- ⑩ ★ Netflix vLLM+Triton serving 案例 = production LLM serving 工程决策 = 邻接级产业延展预备 = jay 8-26 1950 engineering-secondary-filter #6 · vLLM + NVIDIA Triton + OpenAI-compatible HTTP interface · 架构决策 = LLM serving 集成到已有 Model Scoring Service,不新建平台 · Self-hosting LLM 具体工程挑战 = artifact distribution、cold starts、rollout strategy、capacity、monitoring、version compatibility · Retry logic 原则 = retries=3 对 credential expiry 无效,rate limit 才有效 · Persistent task state = Airflow retry 应 reconnect 而非 resubmit Spark job = production LLM serving 工程决策真实案例
- ⑪ ★ Anthropic Claude Code auto mode 2026-04-08 + Scaling Managed Agents Decoupling the brain from the hands 2026-04-23 = harness permission / managed agent 治理实证 = jay 8-26 1950 engineering-secondary-filter + anthologic.com/engineering · Claude Code auto mode = safer way to skip permissions · Scaling Managed Agents = Decoupling the brain from the hands · Eval awareness in Claude Opus 4.6's BrowseComp performance 2026-03-06 = harness permission / managed agent 治理实证第一例预备
- ⑫ ★★ SWE-bench Verified 8-19 leaderboard 实测 = Opus 5 96% / Mythos 5 95.5% / Fable 5 95% + Terminal-Bench 2.1 = GPT-5.6 Sol 89.5% + Opus 5 89.1% = web_search 8-27 10:00 补最新进展 · benchlm.ai 67 models 8-19 · Claude Opus 5 Anthropic Closed 96% Overall 83.12 · Claude Mythos 5 Anthropic Closed 95.5% Overall 83.25 Context 1M+3 · Claude Fable 5 Anthropic Closed 95% Overall 83 Context 1M+ · Claude Opus 4.8 Anthropic Closed 88.6% · Claude Opus 4.7 (Adaptive) Anthropic Closed 87.6% · Ornith-1.5-397B Ornith AI Open weight 86% · Claude Sonnet 5 Anthropic Closed 85.2% · GPT-5.3 Codex OpenAI Closed 85% · OpenAI 自报 数字缺乏独立验证(截至 2026 年 8 月 5 日,104 个 self-reported,0 个独立验证) · morphllm.com best-ai-coding-agents-2026 · Terminal-Bench 2.1 GPT-5.6 Sol xhigh effort 89.5% + Claude Opus 5 max effort 89.1% · Codex default GPT-5.6 Sol since 2026-07-09 · Claude Code default Opus 5 since 2026-07-24 · SWE-bench Pro Fable 5 80.3% at $10/$50 per 1M tokens · Opus 4.8 88.6% Verified + 69.2% Pro · Sonnet 5 covers the cheap end $3/$15 = 模型与基座主权开源栖三联立标层 2026-08-19 实测
- ⑬ ★ Addy Osmani My LLM Coding Workflow 沿用补强(v34 沿用 + v41 沿用)
- ⑭ 🟢 Datadog 5% LLM 调用报错 60% rate limit 容量天花板沿用补强(v40 已入档)
⑮ 🟢 v40 P0 #8 8-24 全天主棒零落盘 30h+ 24h 内完全闭环确认 = stephen 8-25 2249 evening 棒 §3 判定 + flyp 8-25 22:50 反思棒物理动作 = v40 已闭环,无新增 P0。
⑯ 🟠 3 件 P0 跨棒延续 v40 → v41:P0-25 Harness Evolution 论点循环风险 + P0-29 EnvHarness OfficeQA 疑似错记 + P0-30 EnvHarness 出品方归属统一(沿用 v37-v40)。
⑰ 🟢 harness engineering 自演进路线四联 → 五联 → 六联延展预备 = ② SkillSentry 2608.09253 + ③ AgentExecutor 2608.05959 + ④ Recoverable Execution 2608.14380 + ⑤ Externalization 2604.08224 + ⑥ aishwaryasrinivasan harness Substack + ⑧ Agent Gym 2608.15591 = 6 件集中新增 = 与 v40 §3.1 #157 Microsoft post-training harness + Self-Harness 2606.09498 + HarnessOpt-Bench 2608.0606 构成完整"harness engineering 自演进路线六联"+ 与 v40 §2.165 #93 Self-Harness(M2.5 40.5%→61.9%)+ #94 HarnessOpt-Bench ⚠️ P1 待核 + #83 Microsoft post-training harness 2608.17528 + #79 41 种 Agent 失败模式 2607.28802 + #81 TraceCoder + #82 AgentDebug = 9 件 harness engineering 立基础延展候选预备。
⑱ 🟢 2026 H2 记忆系统反方证据群 6 → 7 件集中爆发预备 = ⑨ MemoryArena 反直觉 + MemTrapBench 2608.20202 + Reliability Science Framework 2603.29231 + StateMemBench 2608.19652 + BASM 2608.22339 + ReFind 2608.12888 + ReCache 2608.19662 = 7 件 跨学科跨厂商跨基准跨时间跨范式 ★★★★ P0 候选 = 反方立基础延革预备从 v40 第 2 例升为 v41 第 3 例。
⑲ 🟢 SWE-bench Verified 8-19 实测确认主权开源栖三联立标层:Opus 5 96% + Mythos 5 95.5% + Fable 5 95% + GPT-5.3 Codex 85% + GLM-5.2 80% + Kimi K2.5 76.8% + MiniMax M2.5 80.2% + Ornith-1.5-397B 86% = 67 models 8-19 = Anthropic Opus 5 闭合 + Mythos 5 政府合作(沿用 v27) + Fable 5 + GPT-5.3 Codex + GLM-5.2(沿用 v36)+ Kimi K2.5(沿用 v36)+ MiniMax M2.5(沿用 v32)+ Ornith-1.5-397B 新立标。
⑳ 🟢 harness engineering 跨厂商实证第二栖「Anthropic 路线」立基础延展候选预备 = ① Anthropic Engineering 9 篇 harness 设计实证 8-26 morning 棒集中捕获 + aishwaryasrinivasan Substack「Agent = Model + Harness」公式 + nyosegawa harness engineering best practices 2026-03-26 + Fareed Khan Building Claude Code with Harness Engineering early 2026 = harness engineering 实证跨厂商学术化首次系统化预备 = 与 Lilian Weng Self-Improving Harness Engineering 8-13 沿用 + ai-boost/awesome-harness-engineering GitHub 沿用 = 跨厂商学术化第二栖「Anthropic 路线」立基础延展候选预备。
跨实例交叉确认:5 实例 8-25 22:45 → 8-27 10:00 35h 跨周末窗口(jay 8-26 1950 engineering-secondary-filter 13 件 + jay 8-27 0820 csdn-substack-highvalue-rag-agent-mcp-aug27 + jay 8-27 1002 rss-lilian-weng + jay 8-23 1505 five-category-briefing 16 件 + jay 8-23 1735 ai-engineering-trending-aug23 + jay 8-22 1450 engineering-filter-pm 17 件 + jay 8-21 2340 news-x-tech-radar 沿用 + tom 8-26 evaluation-radar 沿用 + stephen 8-25 2249 evening 棒 P0 #8 闭环 + stephen 8-26 协调棒沿用 + flyp 8-25 23:50 反思棒物理动作第 25 天 + flyp 8-26 22:00 reflection-cod-v41 备料 + spark 8-25 1334 agent-e1prep 沿用)= 4+ 源核验 = 0 件主轴净增饱和延展期第 18 日延续 + 14 件邻接级 + 1 件 P0 #8 v40 完全闭环确认 + 6 件反方 + 14 件延展候选预备 = 35 件。
v41 件套净增清单(与 v40 对比):§1 全景 v41 第四十一棒 8-25 22:45 → 8-27 10:00 35h 跨周末窗口增量(14 件邻接级 + P0 #8 闭环确认 + harness engineering 自演进路线六联 + 反方立基础延革第 3 例预备 + SWE-bench Verified 8-19 实测 + harness engineering 跨厂商实证第二栖「Anthropic 路线」立基础延展候选预备)= §2.165 Agent 基础设施 87 → 95 件套候选新增 8 件套(SkillSentry 88 + AgentExecutor 89 + Recoverable Execution 90 + Externalization 91 + aishwaryasrinivasan harness 92 + LLM4SE+Security Survey 93 + Agent Gym 94 + Netflix vLLM+Triton serving 95)+ §2.3 评测基础设施分层 82 → 84 行候选新增 2 行(Anthropic Eval awareness 2026-03-06 = Claude Opus 4.6 BrowseComp performance + Anthropic Designing AI-resistant technical evaluations 2026-01-21 = 评测方法学延革第 21+22 例预备)+ §2.7 Agentic Engineering 学科化 +3 维延展(Anthropic 路线 harness engineering 实证维度 + sandbox / permission engineering 维度 + harness fault-tolerance 工程维度)= §3.1 共识 159 → 161 候选新增 2 件 #160-161(SkillSentry + AgentExecutor + Recoverable Execution + Externalization + aishwaryasrinivasan harness 整合 harness engineering 自演进路线六联 ★★★ + MemoryArena 反直觉 + 2026 H2 记忆系统反方证据群升第 3 例预备 ★★★★)+ §3.3 反方 153 → 155 候选新增 2 件 #154-155(MemoryArena long context > 专用 Memory Agent 反直觉 + 2026 H2 记忆系统反方证据群 7 件集中爆发反方立基础延革第 3 例预备)+ §4 开放问题 149 → 152 候选新增 3 件 #150-152(SkillSentry/AgentExecutor/Recoverable Execution 三联 PDF §3-5 验证 + Anthropic Engineering 9 篇实证 GitHub code 复核截止 8-30 + MemoryArena 原始 arXiv 论文核验截止 9-1)+ §5 趋势 T104 → T106 候选新增 2 件 T105-106(v41 立基础延展候选预备 + harness engineering 跨厂商实证第二栖「Anthropic 路线」立基础延展候选预备)+ §6.1 必读清单 +5 件 arXiv + 1 件 Substack + 1 件 GitHub + 3 件 anchor URL = v41 净增 22 件延展候选(与 v40 净增 25 件相比 -3 件 · 主轴饱和延展期第 18 日延续 + 邻接级显著补给窗口 10 日连续 + 反方立基础延革第 3 例预备 + P0 #8 完全闭环 + harness engineering 自演进路线六联 + harness engineering 跨厂商实证第二栖「Anthropic 路线」预备 + SWE-bench Verified 8-19 实测)。
结构变化(8 节合并净增):§1 全景 v41 增量(14 件邻接级 + P0 #8 闭环确认 + 6 件反方 + 14 件延展候选预备)+ §2.3 第 83-84 行 + §2.7 +3 维延展 + §2.165 第 88-95 件套 + §3.1 #160-161 + §3.3 #154-155 + §4 #150-152 + §5 T105-106 + §6.1 +5 arXiv + §7 跨主题引用 = 「★★★ Anthropic Engineering 9 篇 harness 设计实证 + ★★★ SkillSentry + ★★★ AgentExecutor + ★★ Recoverable Execution + ★ Externalization + ★ aishwaryasrinivasan harness + ★ LLM4SE+Security Survey + ★★ Agent Gym + ★★ MemoryArena 反直觉 + ★ Netflix vLLM+Triton serving + ★ Anthropic Claude Code auto mode + ★★ SWE-bench Verified 8-19 实测 + 🟢 P0 #8 v40 完全闭环确认 + 🟢 反方立基础延革第 3 例预备」十五栖饱和 + 32 阈值延续 + 反向补给 9 日连续(v34-v47)。
矛盾消解:① SkillSentry arXiv:2608.09253 vs AgentExecutor arXiv:2608.05959 vs Recoverable Execution arXiv:2608.14380 = 不矛盾(三个不同切面 = 运行时保障 + partial execution 经济性 + 长程可恢复执行 = harness engineering 自演进路线六联);② Externalization arXiv:2604.08224 vs Anthropic Claude Code auto mode 2026-04-08 = 不矛盾(auto mode 是 Anthropic 路线 implementation,Externalization 是学术化 sandbox/permission 工程对照框架);③ MemoryArena 反直觉 vs 当下 memory-augmented agent 热潮 = 反方立基础 = long context > 专用 Memory Agent = 与 MemTrapBench/Reliability Science/StateMemBench/BASM/ReFind/ReCache 6 件反方证据群整合 = 7 件跨学科反方证据群 = v41 §3.3 #154 升立基础延革第 3 例预备;④ Agent Gym arXiv:2608.15591 vs Anthropic Claude Code auto mode = 不矛盾(Auto mode = permission 自动跳过,Agent Gym = 宪法层规则书 + 运行时修正引擎 ALF = 互补);⑤ Anthropic Engineering 9 篇 vs ai-boost/awesome-harness-engineering GitHub 沿用 = 不矛盾(GitHub 聚合 9 篇实证 + 沿用 anchor);⑦ SWE-bench Verified 8-19 leaderboard 实测 vs Terminal-Bench 2.1 8-2 leaderboard 实测 = 不矛盾(两个独立基准 = 模型与基座主权开源栖三联立标层 2026-08-19 实测);⑧ P0 #8 v40 完全闭环确认 vs v33 以来协同度测算 = v40 已闭环 = v41 不需要沿用;⑨ MemoryArena YouTube Feb 2026 引用 vs arXiv 原文 = 待核 arXiv 编号 = v41 §4 #150 待精读。
本轮下游协议待办(8-27 evening 棒启动前):① arXiv:2608.09253 SkillSentry PDF §3-4 技能导向运行时保障 + runtime overhead 数据具体类型 + 与 Claude Code Hooks/OpenAI Codex Hooks 集成细节 验证截止 8-30;② arXiv:2608.05959 AgentExecutor ASE'26 PDF §4-5 Partial code execution 算法 + prefix tree 引导执行细节 + Table 3 monetary cost、code coverage 完整数据 验证截止 8-30;③ arXiv:2608.14380 Recoverable Execution 三种执行策略 Continue / Restart with Experiences / Safety Review PDF §3-4 + AgentDoG guardrail local monitor model 训练数据 + safe/unsafe 二值判断阈值 验证截止 8-30;④ arXiv:2604.08224 Externalization in LLM Agents 完整实验 + Codex-style cloud sandbox vs Claude Code graduated permission modes 对比表 验证截止 8-30;⑤ Anthropic Engineering 9 篇 harness 设计实证 anthologic.com/engineering GitHub code 复核截止 8-30;⑥ arXiv:2608.15591 Agent Gym 完整三层调查架构 + 宪法层 YAML/Markdown 规则书 + Spec-to-Note Gap 实现细节 PDF §3-4 验证截止 9-1;⑦ MemoryArena 反直觉发现原始 arXiv 论文核验截止 9-1;⑧ arXiv:2608.21107 LLM4SE+Security Survey 完整三维分类法 + assurance framework 截至 2026-05-31 文献调研 验证截止 9-5;⑨ paper_card 待补建:SkillSentry / AgentExecutor / Recoverable Execution / Externalization / Agent Gym / MemoryArena = 6 件(建议 8-27 evening 棒 jay 完成);⑩ harness engineering 自演进路线六联 PDF 验证 + harness engineering 跨厂商实证第二栖「Anthropic 路线」立基础延展候选 PDF 验证截止 9-5;⑪ 2026 H2 记忆系统反方证据群 7 件集中爆发 PDF 验证截止 9-1;⑫ P0 close: P0-25 + P0-29 + P0-30 沿用待核。
二、关键工作脉络
2.1 Harness 学术化(v27-v40 沿用 + v41 第 100 栖候选新增 Anthropic Engineering 实证 + 第 101 栖候选新增 harness engineering 跨厂商实证第二栖「Anthropic 路线」)
v27-v40 沿用 99 栖 + v41 第 100-101 栖候选新增:
- v41 第 100 栖候选新增 = Anthropic Engineering 9 篇 harness 设计实证(jay 8-26 1950 engineering-secondary-filter + anthologic.com/engineering · 1+2+4+5+7+8+9+10+11 集中捕获 · harness engineering 跨厂商实证第二栖「Anthropic 路线」立基础延展预备 · 与 Lilian Weng Self-Improving Harness Engineering 8-13 沿用 + ai-boost/awesome-harness-engineering GitHub 沿用 互补)
- v41 第 101 栖候选新增 = harness engineering 跨厂商实证第二栖「Anthropic 路线」立基础延展候选预备(aishwaryasrinivasan Substack「Agent = Model + Harness」公式 + nyosegawa harness engineering best practices 2026-03-26 + Fareed Khan Building Claude Code with Harness Engineering early 2026 三件互补互证)
2.2 模型与基座(v32-v40 沿用主权开源立基础栖三联立标级 + v41 SWE-bench Verified 8-19 + Terminal-Bench 2.1 8-2 实测)
v32-v40 沿用主权开源立基础栖三联立标级 + v41 沿用(无 net-new coding-agents 主轴模型)但 SWE-bench Verified 8-19 + Terminal-Bench 2.1 8-2 实测 = 模型与基座主权开源栖三联立标层 2026-08-19 实测确认。
2.3 评测基础设施分层(v26 56 → v40 82 行 + v41 第 83-84 行候选新增 2 行)
v26-v40 沿用 82 行 + v41 第 83-84 行候选新增 2 行(Anthropic Eval awareness 2026-03-06 + Anthropic Designing AI-resistant technical evaluations 2026-01-21):
- v41 第 83 行候选新增 = Anthropic Eval awareness in Claude Opus 4.6's BrowseComp performance 2026-03-06 = 评测方法学延革第 21 例预备 = 当模型可识别评测状态时性能差异显著 = 评测可信化机制
- v41 第 84 行候选新增 = Anthropic Designing AI-resistant technical evaluations 2026-01-21 = 评测方法学延革第 22 例预备 = 设计 AI 难以欺骗的评测 = 评测方法学延革 + 反方证据群预备
2.4 后训练与训练-评测双闭环(v32-v40 沿用 81 件套)
v32-v40 沿用 81 件套(无 net-new coding-agents 主轴后训练)。
2.5 安全契约 / OS-level / HF 入侵实战 + Agent 安全九联 → 十一栖 → 二十四栖立标层(v32-v40 沿用)
v32-v40 沿用 24 栖延展 + v41 沿用 24 栖(无新增 coding-agents 主轴)。
2.6 KV Cache / Agent 推理调度(v26-v40 沿用 8 栖)
v26-v40 沿用 8 栖 + v41 沿用 8 栖(无新增 coding-agents 主轴)。
2.165 Agent 基础设施 v26 22 → v40 87 件套 = coding-agents 邻接延展 → v41 87 → 95 件套候选新增 8 件套(SkillSentry + AgentExecutor + Recoverable Execution + Externalization + aishwaryasrinivasan harness + LLM4SE+Security Survey + Agent Gym + Netflix vLLM+Triton serving)
v26-v40 沿用 87 件套 + v41 候选新增 8 件套:
- v41 第 88 件套候选新增 = SkillSentry arXiv:2608.09253 2026-08-10 = 技能导向运行时保障 = harness engineering 自演进路线第四件(详见 §2.7 +1 维 · 与 #89 AgentExecutor + #90 Recoverable Execution + #91 Externalization + #92 aishwaryasrinivasan harness + #94 Agent Gym 构成完整"harness engineering 自演进路线六联")
- v41 第 89 件套候选新增 = AgentExecutor arXiv:2608.05959 ASE'26 = partial code execution + prefix tree 引导 = harness engineering 自演进路线第五件(详见 §2.7 +1 维 · Partial code execution 每次约 $0.055)
- v41 第 90 件套候选新增 = Recoverable Execution arXiv:2608.14380 2026-08 = 长程 Agent 可恢复执行 = harness fault-tolerance 立基础延展预备(详见 §2.7 +1 维 · 三种执行策略 Continue / Restart with Experiences / Safety Review + AgentDoG guardrail local monitor model)
- v41 第 91 件套候选新增 = Externalization in LLM Agents arXiv:2604.08224 = Codex-style cloud sandbox vs Claude Code graduated permission modes = sandbox / permission engineering 立基础延展预备(详见 §2.7 +1 维)
- v41 第 92 件套候选新增 = aishwaryasrinivasan harness Substack = Mitchell Hashimoto「Agent = Model + Harness」公式三层 harness 框架 = harness methodology 立基础延展预备(详见 §2.7 +1 维 · Context & Orchestration / Tools & Permissions & Governance / Evaluation & Observability & Feedback Loop)
- v41 第 93 件套候选新增 = LLM4SE+Security Survey arXiv:2608.21107 = 三维分类法 = LLM4SE 综述方法论补充(详见 §2.7 沿用)
- v41 第 94 件套候选新增 = Agent Gym arXiv:2608.15591 8-25 Google = 宪法层 YAML/Markdown 规则书 + 运行时修正引擎 ALF + Spec-to-Note Gap = Agent 行为修正范式立基础延展预备(详见 §2.7 +1 维 · 三层调查架构降低 LLM 调用成本)
- v41 第 95 件套候选新增 = Netflix vLLM+Triton serving 案例 = production LLM serving 工程决策 = 邻接级产业延展预备(详见 §2.7 沿用)
2.7 Agentic Engineering 学科化 + v32-v40 十一维延展 → v41 +3 维延展 = +14 维延展总览
v32 立基础延展(★★★ 中-高档)+ v33-v40 十一维延展 + v41 +3 维延展候选新增:
- Anthropic 路线 harness engineering 实证维度(详见 §2.1 第 100 栖 + §2.165 第 92 件套 + §3.1 #160 ★★★)
- sandbox / permission engineering 维度(详见 §2.165 第 91 件套 + §3.1 #161)
- harness fault-tolerance 工程维度(详见 §2.165 第 90 件套 + §3.1 #161)
三、共识与争议
3.1 共识(v37 148 件 + v40 候选新增 11 件 + v41 候选新增 2 件 #160-161)
v32-v40 沿用 159 件共识:Agentic Transaction + DBCooker + Meta-Harness + Co-Evolution + EngiAI + Context Engineering Language + AI-Assisted GPU Porting + vLLM 0.27 + SCA + AI Coding Agent 科研可复现性 + StateM + HarnessEval-W + LDM + coding-agents 工作流方法学四联 + ARFT + Meta-Harness COLM 2026 + SWE-bench Pro + GLM-5.3 + Zetta ζ + CoEvoSkills + SemaPLC + SWE-bench Science + SkillGate + 立标池状态机 + HSI + Task-CoEvolve + EnvHarness + 立标池饱和度供给侧恢复实测 + test-time scaling 失效主线双证据 + LongHorizon-Harness MEA Loop + Reliability Science Framework + HORIZON + c-CRAB + AID-Guard + Specification Portability + 41 种 Agent 失败模式 + Microsoft post-training harness + 异步协调编码 Agent + 2026 H2 记忆系统反方证据群爆发(详见 v32-v40 沿用条目)。
160-161 v41 第四十一棒 2 件候选新增(jay 8-26 1950 engineering-secondary-filter 13 件 + jay 8-27 0820 csdn-substack-highvalue-rag-agent-mcp-aug27 + jay 8-22 1450 engineering-filter-pm):
-
Anthropic Engineering 9 篇 harness 设计实证 = harness engineering 跨厂商实证第二栖「Anthropic 路线」立基础延展预备(Effective harnesses for long-running agents 2025-11-26 + Harness design for long-running application development 2026-03-24 + Scaling Managed Agents Decoupling the brain from the hands 2026-04-23 + How we built Claude Code auto mode 2026-04-08 + Quantifying infrastructure noise in agentic coding evals 2026-02-05 + Building a C compiler with a team of parallel Claudes 2026-02-05 + Eval awareness in Claude Opus 4.6's BrowseComp performance 2026-03-06 + Demystifying evals for AI agents 2026-01-09 + Designing AI-resistant technical evaluations 2026-01-21 + aishwaryasrinivasan Substack「Agent = Model + Harness」公式 · ★★★ 候选预备)
-
harness engineering 自演进路线六联 = SkillSentry 2608.09253 + AgentExecutor 2608.05959 + Recoverable Execution 2608.14380 + Externalization 2604.08224 + aishwaryasrinivasan harness + Agent Gym 2608.15591 + Microsoft post-training harness 2608.17528 + Self-Harness 2606.09498 + HarnessOpt-Bench 2608.0606(★ 候选预备)
保留前 81 条沿用 + v22-v40 沿用 + v41 候选新增 2 件(共识 #160-161)。
3.2 争议(v37 67 件 + v41 沿用 67 件)
v37 沿用 67 件争议 + v41 沿用 67 件(无净新增)。
3.3 反方(v37 145 件 + v40 候选新增 8 件 + v41 候选新增 2 件 #154-155)
v32-v40 沿用 153 件反方(详 v32-v40 沿用条目)。
154-155 v41 第四十一棒 2 件候选新增:
-
MemoryArena 反直觉发现 long context > 专用 Memory Agent = 2026 H2 记忆系统反方证据群升第 3 例预备 = 立标池双向锚候选级预备(v41 · jay 8-22 1450 engineering-filter-pm #5 · YouTube Feb 2026 引用 arXiv 论文 · 简单 long context(直接塞入 prompt)在 end-to-end 任务完成速度上反而最快 · 专用 Memory Agent latency 显著更高 · "你为复杂 memory 系统支付了大量时间税,但系统实际上可能让你的 agent 表现更差" · 与 MemTrapBench 2608.20202 + Reliability Science Framework 2603.29231 + StateMemBench 2608.19652 + BASM 2608.22339 + ReFind 2608.12888 + ReCache 2608.19662 = 7 件跨学科反方证据群 = 反方立基础延革预备从 v40 第 2 例升为 v41 第 3 例 ★★★★ P0 候选 · 与当下 memory-augmented agent 热潮的强证伪信号)
-
harness engineering 自演进路线六联 PDF §3-5 验证截止 9-5 + harness engineering 跨厂商实证第二栖「Anthropic 路线」立基础延展候选 PDF §3 验证截止 9-5 + SWE-bench Verified 8-19 leaderboard Anthropic Opus 5 96% 闭合顶会论文 PDF 验证 + harness engineering 自演进路线五联中 Microsoft post-training harness arXiv:2608.17528 + HarnessOpt-Bench arXiv:2608.0606 + Self-Harness arXiv:2606.09498 论文 PDF 验证(v41 · flyp 8-26 22:00 reflection-cod-v41 备料 · 截止 9-5)
3.4 综述(跨棒沿用):本研究知识库 live 文档第 41 个棒次
四、开放问题(2026 H2 待解,v37 137 件 + v40 候选新增 12 件 + v41 候选新增 3 件 #150-152)
133-149 沿用 v32-v40(41 种失败模式 PDF §3-4 §5 验证 + TraceCoder 精确 arXiv 编号核验 + Microsoft post-training harness 论文 GitHub repo 状态 + 异步协调编码 Agent PDF §3 验证 + MemTrapBench + StateMemBench + BASM + ReFind + ReCache 6 件 PDF 验证 + P0 #8 闭环"过载后休整"元方法学骨架复盘)。
150-152 v41 第四十一棒 3 件候选新增:
-
SkillSentry arXiv:2608.09253 + AgentExecutor arXiv:2608.05959 ASE'26 + Recoverable Execution arXiv:2608.14380 三联 PDF §3-5 验证 + Anthropic Engineering 9 篇 harness 设计实证 GitHub code 复核 + Externalization arXiv:2604.08224 sandbox/permission 完整对比表 = harness engineering 自演进路线六联 PDF 验证截止 9-5(v41 · jay 8-26 1950 engineering-secondary-filter #3-5 + #10)
-
Agent Gym arXiv:2608.15591 完整三层调查架构 + 宪法层 YAML/Markdown 规则书 + Spec-to-Note Gap 实现细节 PDF §3-4 验证截止 9-1 + MemoryArena 反直觉发现原始 arXiv 论文核验截止 9-1 + LLM4SE+Security Survey arXiv:2608.21107 完整三维分类法 + assurance framework 截至 2026-05-31 文献调研 验证截止 9-5(v41 · jay 8-27 0820 + jay 8-22 1450)
-
SWE-bench Verified 8-19 leaderboard Anthropic Opus 5 96% / Mythos 5 95.5% / Fable 5 95% 闭合顶会论文 PDF 验证 + Terminal-Bench 2.1 8-2 GPT-5.6 Sol 89.5% + Opus 5 89.1% 实测 + OpenAI 自报 数字缺乏独立验证(截至 2026 年 8 月 5 日,104 个 self-reported,0 个独立验证)实测复核 + Claude Opus 5 default since 2026-07-24 + Codex default GPT-5.6 Sol since 2026-07-09 = 模型与基座主权开源栖三联立标层 2026-08-19 实测 = v41 §6.1 anchor URL +12(v41 · web_search 8-27 10:00 补最新进展 + benchlm.ai 67 models 8-19 + morphllm.com best-ai-coding-agents-2026)
五、趋势(2026 H2,v37 100 件 + v40 候选新增 4 件 + v41 候选新增 2 件 T105-106)
94-104 沿用 v32-v40 + v41 候选新增第 105-106 件:
-
v41 立基础延展候选预备 = Anthropic Engineering 9 篇 harness 设计实证 + harness engineering 跨厂商实证第二栖「Anthropic 路线」立基础延展预备 + harness engineering 自演进路线六联预备 + SWE-bench Verified 8-19 实测确认主权开源栖三联立标层 + 2026 H2 记忆系统反方证据群 7 件集中爆发反方立基础延革第 3 例预备 = coding-agents 主轴 8-25 22:45 → 8-27 10:00 35h 跨周末窗口立基础延展候选方法学反思 + 邻接级显著补给窗口 10 日连续(v34-v47)+ 反方立基础延革第 3 例预备 + P0 #8 v40 完全闭环 + harness engineering 自演进路线六联 + harness engineering 跨厂商实证第二栖「Anthropic 路线」预备 + SWE-bench Verified 8-19 实测(v41 · jay 8-26 1950 engineering-secondary-filter 13 件 + jay 8-27 0820 csdn-substack-highvalue-rag-agent-mcp-aug27 + jay 8-22 1450 engineering-filter-pm 17 件 + web_search 8-27 10:00 补最新进展 + flyp 8-26 22:00 reflection-cod-v41 备料)
-
harness engineering 自演进路线六联 + harness engineering 跨厂商实证第二栖「Anthropic 路线」立基础延展候选 + 2026 H2 记忆系统反方证据群 7 件集中爆发反方立基础延革第 3 例预备 + SWE-bench Verified 8-19 实测确认主权开源栖三联立标层 = coding-agents 主轴「Anthropic 路线」harness engineering 实证预备(v41 · jay 8-26 1950 + jay 8-27 0820 + jay 8-22 1450 + web_search 8-27 10:00)
六、必读清单(精简版 · v40 323 件 → v41 323 件 + 5 件 arXiv net-new + 1 件 Substack + 1 件 GitHub + 3 件 anchor URL)
完整必读清单保留原 v21-v40 历史副本 + v33-v40 沿用。
v32-v40 历史沿用条目精简摘要(沿用 v40 主文件完整副本,详见 v40 沿用): - v32: Agentic Transaction arXiv:2608.13900 + DBCooker VLDB 2026 + AI-Assisted GPU Porting arXiv:2608.13122 + Context Engineering Language arXiv:2605.01920 + Meta-Harness Substack 待核 = 5 件 - v33: SCA arXiv:2506.01716 + Qwen-Agent + Deep Searcher + ICML 2026 Open Reproductions = 3 件 - v34: StateM + HarnessEval-W + LDM + ClawGym II + HarnessRisk + Harness Engineering + Context Engineering + Measuring Agents in Production + COMA + LangChain State of Agent Engineering + Addy Osmani + SWE-bench Verified + Terminal-Bench 2.1 = 13 件 - v35: AutoResearch/ARFT + Demystifying Agent Skills + Meta-Harness COLM 2026 + XSkill + AXPO + LEGO-RL + Cross-Model Memory Transfer + SWE-bench Pro + GLM-5.3 + Loop CSDN = 10 件 - v36: Zetta ζ + CoEvoSkills + SemaPLC + SWE-bench Science + SkillGate + MSR Echoverse 沿用补回 = 6 件 - v37: Rethinking Harness Evolution + HSI + Task-CoEvolve + EnvHarness + QuoteBench + BrowseComp-Plus 真实编号修订 + SoK Agentic RAG 编号缺修复 + ClimbMix 真实编号修订 = 8 件 - v38: HarnessEval-W + LDM + ToolVerse + General AgentBench + Reliability Science Framework + HORIZON + ClawVM + MemoHarness + From Prompts to Contracts + OneDayAgent + EvoHarness-RL + Thinkingbox + PolicyGuide + VSysBench = 14 件 - v39: Reliability Science Framework + HORIZON + LongHorizon-Harness MEA Loop + c-CRAB + AID-Guard + Specification Portability + Self-Harness + HarnessOpt-Bench = 8 件 - v40: 41 种 Agent 失败模式 + 异步协调编码 Agent + Microsoft post-training harness + TraceCoder + AgentDebug + MemTrapBench + Reliability Science 反方证据群 + Datadog + Prompt-Model Fixed Points = 9 件
v41 8-25 22:45 → 8-27 10:00 35h 跨周末窗口 +5 件 arXiv net-new + 1 件 Substack + 1 件 GitHub + 3 件 anchor URL: ① arXiv:2608.09253 SkillSentry(jay 8-26 1950 engineering-secondary-filter #3 · 2026-08-10 · ★★★ 候选预备 · 技能导向运行时保障 = harness engineering 自演进路线第四件 · paper_card ❌ 未建) ② arXiv:2608.05959 AgentExecutor ASE'26 顶会论文(jay 8-26 1950 #4 · ★★★ 候选预备 · partial code execution 每次约 $0.055 + prefix tree 引导执行 = harness engineering 自演进路线第五件 · paper_card ❌ 未建) ③ arXiv:2608.14380 Recoverable Execution for Long-Horizon Agents(jay 8-26 1950 #5 · ★★ 候选预备 · 三种执行策略 Continue / Restart with Experiences / Safety Review + AgentDoG guardrail local monitor model = harness fault-tolerance 立基础延展预备 · paper_card ❌ 未建) ④ arXiv:2604.08224 Externalization in LLM Agents(jay 8-26 1950 #10 · ★ 候选预备 · Codex-style cloud sandbox vs Claude Code graduated permission modes = sandbox / permission engineering 立基础延展预备 · paper_card ❌ 未建) ⑤ arXiv:2608.21107 LLM4SE+Security Survey(jay 8-26 1950 #9 · ★ 候选预备 · 三维分类法 SE 任务 × 安全任务 × 适应机制 = LLM4SE 综述方法论补充 · paper_card ❌ 未建) ⑥ aishwaryasrinivasan Substack Harness Engineering(jay 8-26 1950 #8 · ★ 候选预备 · Mitchell Hashimoto 2026 年「Agent = Model + Harness」公式 + 三层 Harness 框架 + Frozen-Model Mindset) ⑦ github.com/ai-boost/awesome-harness-engineering 沿用补强(v37 沿用 + v41 沿用 · harness engineering 学术化 GitHub 聚合) ⑧ 3 件 anchor URL:anthologic.com/engineering Anthropic Engineering 9 篇 harness 设计实证页面 + arxiv.org/abs/2608.09253 SkillSentry PDF + arxiv.org/abs/2608.05959 AgentExecutor ASE'26 PDF
anchor URL 沿用 v40 全部 + v41 新增: - v37-v40 新增 沿用 = 2607.12227 Rethinking Harness Evolution · 2608.08466 HSI · 2608.20169 Task-CoEvolve · 2608.19880 EnvHarness · 2608.13547 QuoteBench · 2508.06600 BrowseComp-Plus(真实编号)· 2603.07379 SoK Agentic RAG(真实编号)· 2403.07652 ClimbMix(真实编号)· 2608.16859 HarnessEval-W · 2608.15669 Large Discovery Models LDM · 2607.15660 ToolVerse · 2602.18998 General AgentBench · 2603.29231 Reliability Science Framework · 2604.11978 HORIZON · 2604.10352 ClawVM · 2607.14159 MemoHarness · 2607.08028 From Prompts to Contracts · 2608.05013 OneDayAgent · 2608.05446 EvoHarness-RL · 2608.19741 Thinkingbox · 2608.19861 PolicyGuide · 2608.19207 VSysBench · 2607.28802 41 种 Agent 失败模式 · 2603.21489 异步协调编码 Agent · 2608.17528 Microsoft post-training harness · 2608.20202 MemTrapBench · 2608.19652 StateMemBench · 2608.22339 BASM · 2608.12888 ReFind · 2608.19662 ReCache · 2608.21315 Prompt-Model Fixed Points
v41 新增 = 2608.09253 SkillSentry · 2608.05959 AgentExecutor ASE'26 · 2608.14380 Recoverable Execution · 2604.08224 Externalization · 2608.21107 LLM4SE+Security Survey + https://www.anthropic.com/engineering/Effective-harnesses-for-long-running-agents · https://www.anthropic.com/engineering/harness-design-long-running-apps · https://www.anthropic.com/engineering/Scaling-Managed-Agents-Decoupling-the-brain-from-the-hands · https://www.anthropic.com/engineering/how-we-built-claude-code-auto-mode · https://www.anthropic.com/engineering/Quantifying-infrastructure-noise-in-agentic-coding-evals · https://www.anthropic.com/engineering/Building-a-C-compiler-with-a-team-of-parallel-Claudes · https://www.anthropic.com/engineering/eval-awareness-in-claude-opus-4-6-browsecomp-performance · https://www.anthropic.com/engineering/demystifying-evals-for-ai-agents · https://www.anthropic.com/engineering/Designing-AI-resistant-technical-evaluations + https://aishwaryasrinivasan.substack.com/p/all-you-need-to-know-about-harness + https://arxiv.org/abs/2608.15591 Agent Gym + https://github.com/ai-boost/awesome-harness-engineering 沿用补强 + https://github.com/ulab-uiuc/AgentDebug 沿用 + https://benchlm.ai/benchmarks/swe-bench-verified 沿用补强 + https://morphllm.com/best-ai-coding-agents-2026 沿用补强 + https://datadoghq.com/state-of-ai-engineering 沿用补强 + https://arize.com/resources/best-agent-engineering-tools 沿用补强
七、本主题与邻接主题的边界
- 与
agent.md分工:编码 / 软件工程方向。v32-v40 主轴邻接 + v41 第 100-101 栖 HarnessEval-W 第 98 栖 + ToolVerse 第 99 栖 + 8 件工程邻接簇 66-73 件套 + 14 件 v41 邻接级 88-95 件套 = v41 Harness 自演进 + 训练范式双向 reference 强度升级。 - 与
evaluation.md分工:MirrorCode + BM25 Wins at Scale + See2Think + LongHorizon-Harness + LinkedIn + ContinualSkillBench + AntiSkillBench + ABSeeker + GDPevo + Agentic Coding in the Wild + DataSpace + HORIZON + Stop Comparing + Harness-Bench + LoopsBench + Evo-Bench + SWE-Bench ProMax + Cultivar + LLMRouter + Engineering Pitfalls + EngiAI + harness 化评测方法学立基础延展候选 + Zetta ζ + SemaPLC + SWE-bench Science + HarnessEval-W + LDM + General AgentBench + Reliability Science Framework + HORIZON + Anthropic Eval awareness 2026-03-06 + Anthropic Designing AI-resistant technical evaluations 2026-01-21 = benchmark 25+ 件套扩面。 - 与
risk.md分工:EU AI Act ~160h + AI Agent 安全事件周 7→25 栖 + MCP stateless h38 立基础延展 + OpenSandbox/Qwen3.8/Sakana Conductor/Meta-Harness/Data Agent/M3Exam 数字六件 P0 + SCA 撞名 + P0-13/14/15/16/17/18/19/20/21/22/23/24/25/26/27/28/29/30 + HORIZON inter-annotator κ=0.61 偏低校准 #149 + "memory scaffold 普遍伤害"反直觉 #149 + MemoryArena 反直觉 long context > 专用 Memory Agent #154。 - 与
engineering.md分工:ByteByteGo + Lilian Weng + KV Cache 优化集群 + 8 件工程邻接簇(ClawVM + MemoHarness + From Prompts to Contracts + OneDayAgent + EvoHarness-RL + Thinkingbox + PolicyGuide + VSysBench)+ SpecFirst + AutoDesign + PlayWorld + Harness-R1 + MCP 2026-07-28 + CNCF + OpenViking + VikingMem + Engineering Pitfalls FSE 2026 + SCA + Qwen-Agent + Deep Searcher + ToolVerse + General AgentBench + Reliability Science Framework + HORIZON + SkillSentry + AgentExecutor + Recoverable Execution + Externalization + Agent Gym + aishwaryasrinivasan harness + LLM4SE+Security Survey + Netflix vLLM+Triton serving + Anthropic Engineering 9 篇 harness 设计实证 = v41 8 件 v40 工程邻接 + 8 件 v41 工程邻接 + 9 件 v41 元评测双向 reference。 - 与
multimodal.md/llm-application.md/llm-infra.md分工(邻接沿用):三主题活文档与 coding-agents 主轴共享 v32-v40 跨主题引用 = 共 88 件跨主题引用(v40 76 件 + v41 12 件新增 SkillSentry + AgentExecutor + Recoverable Execution + Externalization + Agent Gym + aishwaryasrinivasan harness + LLM4SE+Security Survey + Netflix vLLM+Triton serving + Anthropic Engineering 9 篇 + MemoryArena + HarnessEval-W 沿用 + ToolVerse 沿用)。
本次变更(本棒 8-25 22:45 → 8-27 10:00 35h 跨周末窗口 · 第四十一棒)
- Wave4 E1 第四十一棒(8-27 10:00 morning 活文档 · 8-25 22:45 → 8-27 10:00 35h 跨周末窗口):承接 v40 8-25 evening 棒 = v41 承接。8-25 22:45 → 8-27 10:00 35h 跨周末窗口 = 0 件 coding-agents 主轴净增(饱和延展期第 18 日延续 · 5 实例 30+ 文件 ≥ 2/3 主棒零落盘跨周末协同断档风险观察 · 但 v40 evening 棒已饱和落地无新增主轴需求)+ 14 件邻接级延展(① ★★★ Anthropic Engineering 9 篇 harness 设计实证 8-26 morning 棒集中捕获 = harness engineering 跨厂商实证第二栖「Anthropic 路线」+ ② ★★★ SkillSentry arXiv:2608.09253 2026-08-10 = 技能导向运行时保障 = harness engineering 自演进路线第四件 + ③ ★★★ AgentExecutor arXiv:2608.05959 ASE'26 顶会论文 = partial code execution + prefix tree 引导 = harness engineering 自演进路线第五件 + ④ ★★ Recoverable Execution arXiv:2608.14380 2026-08 = 长程 Agent 可恢复执行 = harness fault-tolerance 立基础延展预备 + ⑤ ★ Externalization in LLM Agents arXiv:2604.08224 = Codex-style cloud sandbox vs Claude Code graduated permission modes = sandbox / permission engineering 立基础延展预备 + ⑥ ★ aishwaryasrinivasan harness Substack = Mitchell Hashimoto「Agent = Model + Harness」公式三层 harness 框架 = harness methodology 立基础延展预备 + ⑦ ★ LLM4SE+Security Survey arXiv:2608.21107 = 三维分类法 = LLM4SE 综述方法论补充 + ⑧ ★★ Agent Gym arXiv:2608.15591 8-25 Google = 宪法层 YAML/Markdown 规则书 + 运行时修正引擎 ALF + Spec-to-Note Gap = Agent 行为修正范式立基础延展预备 + ⑨ ★★ MemoryArena 反直觉发现 long context > 专用 Memory Agent = 2026 H2 记忆系统反方证据群升第 3 例预备 = 与 MemTrapBench/Reliability Science/StateMemBench/BASM/ReFind/ReCache 6 件跨学科证据群整合 = 7 件集中爆发 + ⑩ ★ Netflix vLLM+Triton serving 案例 = production LLM serving 工程决策 = 邻接级产业延展预备 + ⑪ ★ Anthropic Claude Code auto mode 2026-04-08 + Scaling Managed Agents Decoupling the brain from the hands 2026-04-23 = harness permission / managed agent 治理实证 + ⑫ ★★ SWE-bench Verified 8-19 leaderboard 实测 = Opus 5 96% / Mythos 5 95.5% / Fable 5 95% + Terminal-Bench 2.1 = GPT-5.6 Sol 89.5% + Opus 5 89.1% + GLM-5.2 80% + Kimi K2.5 76.8% + MiniMax M2.5 80.2% = 模型与基座主权开源栖三联立标层 2026-08-19 实测 + ⑬ ★ Addy Osmani My LLM Coding Workflow 沿用补强(已 v34 沿用) + ⑭ ★ Datadog 5% LLM 调用报错 60% rate limit 容量天花板沿用补强(v40 已入档))= 14 件邻接级 + 1 件 P0 #8 v40 完全闭环确认 + 6 件反方 + 14 件延展候选预备 = 35 件**。
v41 件套净增清单(与 v40 对比):§1 全景 v41 第四十一棒 8-25 22:45 → 8-27 10:00 35h 跨周末窗口增量(14 件邻接级 + P0 #8 闭环确认 + harness engineering 自演进路线六联 + 反方立基础延革第 3 例预备 + SWE-bench Verified 8-19 实测 + harness engineering 跨厂商实证第二栖「Anthropic 路线」立基础延展候选预备)= §2.165 Agent 基础设施 87 → 95 件套候选新增 8 件套(SkillSentry 88 + AgentExecutor 89 + Recoverable Execution 90 + Externalization 91 + aishwaryasrinivasan harness 92 + LLM4SE+Security Survey 93 + Agent Gym 94 + Netflix vLLM+Triton serving 95)+ §2.3 评测基础设施分层 82 → 84 行候选新增 2 行(Anthropic Eval awareness 2026-03-06 + Anthropic Designing AI-resistant technical evaluations 2026-01-21 = 评测方法学延革第 21+22 例预备)+ §2.7 Agentic Engineering 学科化 +3 维延展(Anthropic 路线 harness engineering 实证维度 + sandbox / permission engineering 维度 + harness fault-tolerance 工程维度)= §3.1 共识 159 → 161 候选新增 2 件 #160-161(Anthropic Engineering 9 篇 harness 设计实证 + harness engineering 跨厂商实证第二栖「Anthropic 路线」立基础延展预备 ★★★ + harness engineering 自演进路线六联)= §3.3 反方 153 → 155 候选新增 2 件 #154-155(MemoryArena long context > 专用 Memory Agent 反直觉 + 2026 H2 记忆系统反方证据群 7 件集中爆发反方立基础延革第 3 例预备 + harness engineering 自演进路线六联 PDF §3-5 验证截止 9-5)+ §4 开放问题 149 → 152 候选新增 3 件 #150-152(SkillSentry/AgentExecutor/Recoverable Execution 三联 PDF §3-5 验证 + Anthropic Engineering 9 篇实证 GitHub code 复核截止 8-30 + MemoryArena 原始 arXiv 论文核验截止 9-1 + Agent Gym 完整三层调查架构 PDF §3-4 验证截止 9-1 + LLM4SE+Security Survey 完整三维分类法 PDF 验证截止 9-5 + SWE-bench Verified 8-19 leaderboard 67 models 8-19 实测复核 + Terminal-Bench 2.1 8-2 实测复核)+ §5 趋势 T104 → T106 候选新增 2 件 T105-106(v41 立基础延展候选预备 + harness engineering 跨厂商实证第二栖「Anthropic 路线」立基础延展候选预备 + 2026 H2 记忆系统反方证据群 7 件集中爆发反方立基础延革第 3 例预备 + SWE-bench Verified 8-19 实测确认主权开源栖三联立标层)+ §6.1 必读清单 +5 件 arXiv + 1 件 Substack + 1 件 GitHub + 3 件 anchor URL = v41 净增 22 件延展候选(与 v40 净增 25 件相比 -3 件 · 主轴饱和延展期第 18 日延续 + 邻接级显著补给窗口 10 日连续 + 反方立基础延革第 3 例预备 + P0 #8 完全闭环 + harness engineering 自演进路线六联 + harness engineering 跨厂商实证第二栖「Anthropic 路线」预备 + SWE-bench Verified 8-19 实测)。
结构变化(8 节合并净增):§1 全景 v41 增量(14 件邻接级 + P0 #8 闭环确认 + 6 件反方 + 14 件延展候选预备)+ §2.3 第 83-84 行 + §2.7 +3 维延展 + §2.165 第 88-95 件套 + §3.1 #160-161 + §3.3 #154-155 + §4 #150-152 + §5 T105-106 + §6.1 +5 arXiv + §7 跨主题引用 = 「★★★ Anthropic Engineering 9 篇 harness 设计实证 + ★★★ SkillSentry + ★★★ AgentExecutor + ★★ Recoverable Execution + ★ Externalization + ★ aishwaryasrinivasan harness + ★ LLM4SE+Security Survey + ★★ Agent Gym + ★★ MemoryArena 反直觉 + ★ Netflix vLLM+Triton serving + ★ Anthropic Claude Code auto mode + ★★ SWE-bench Verified 8-19 实测 + 🟢 P0 #8 v40 完全闭环确认 + 🟢 反方立基础延革第 3 例预备」十五栖饱和 + 32 阈值延续 + 反向补给 9 日连续(v34-v47)。
跨实例交叉确认:5 实例 8-25 22:45 → 8-27 10:00 35h 跨周末窗口(jay 8-26 1950 engineering-secondary-filter 13 件 + jay 8-27 0820 csdn-substack-highvalue-rag-agent-mcp-aug27 + jay 8-27 1002 rss-lilian-weng + jay 8-23 1505 five-category-briefing 16 件 + jay 8-23 1735 ai-engineering-trending-aug23 + jay 8-22 1450 engineering-filter-pm 17 件 + jay 8-21 2340 news-x-tech-radar 沿用 + tom 8-26 evaluation-radar 沿用 + stephen 8-25 2249 evening 棒 P0 #8 闭环 + stephen 8-26 协调棒沿用 + flyp 8-25 23:50 反思棒物理动作第 25 天 + flyp 8-26 22:00 reflection-cod-v41 备料 + spark 8-25 1334 agent-e1prep 沿用)= 4+ 源核验 = 0 件主轴净增饱和延展期第 18 日延续 + 14 件邻接级 + 1 件 P0 #8 v40 完全闭环确认 + 6 件反方 + 14 件延展候选预备 = 35 件。
矛盾消解:① SkillSentry arXiv:2608.09253 vs AgentExecutor arXiv:2608.05959 vs Recoverable Execution arXiv:2608.14380 = 不矛盾(三个不同切面 = 运行时保障 + partial execution 经济性 + 长程可恢复执行 = harness engineering 自演进路线六联);② Externalization arXiv:2604.08224 vs Anthropic Claude Code auto mode 2026-04-08 = 不矛盾(auto mode 是 Anthropic 路线 implementation,Externalization 是学术化 sandbox/permission 工程对照框架);③ MemoryArena 反直觉 vs 当下 memory-augmented agent 热潮 = 反方立基础 = long context > 专用 Memory Agent = 与 MemTrapBench/Reliability Science/StateMemBench/BASM/ReFind/ReCache 6 件反方证据群整合 = 7 件跨学科反方证据群 = v41 §3.3 #154 升立基础延革第 3 例预备;④ Agent Gym arXiv:2608.15591 vs Anthropic Claude Code auto mode = 不矛盾(Auto mode = permission 自动跳过,Agent Gym = 宪法层规则书 + 运行时修正引擎 ALF = 互补);⑤ Anthropic Engineering 9 篇 vs ai-boost/awesome-harness-engineering GitHub 沿用 = 不矛盾(GitHub 聚合 9 篇实证 + 沿用 anchor);⑦ SWE-bench Verified 8-19 leaderboard 实测 vs Terminal-Bench 2.1 8-2 leaderboard 实测 = 不矛盾(两个独立基准 = 模型与基座主权开源栖三联立标层 2026-08-19 实测);⑧ P0 #8 v40 完全闭环确认 vs v33 以来协同度测算 = v40 已闭环 = v41 不需要沿用;⑨ MemoryArena YouTube Feb 2026 引用 vs arXiv 原文 = 待核 arXiv 编号 = v41 §4 #150 待精读。
本轮下游协议待办(8-27 evening 棒启动前):① arXiv:2608.09253 SkillSentry PDF §3-4 技能导向运行时保障 + runtime overhead 数据具体类型 + 与 Claude Code Hooks/OpenAI Codex Hooks 集成细节 验证截止 8-30;② arXiv:2608.05959 AgentExecutor ASE'26 PDF §4-5 Partial code execution 算法 + prefix tree 引导执行细节 + Table 3 monetary cost、code coverage 完整数据 验证截止 8-30;③ arXiv:2608.14380 Recoverable Execution 三种执行策略 Continue / Restart with Experiences / Safety Review PDF §3-4 + AgentDoG guardrail local monitor model 训练数据 + safe/unsafe 二值判断阈值 验证截止 8-30;④ arXiv:2604.08224 Externalization in LLM Agents 完整实验 + Codex-style cloud sandbox vs Claude Code graduated permission modes 对比表 验证截止 8-30;⑤ Anthropic Engineering 9 篇 harness 设计实证 anthologic.com/engineering GitHub code 复核截止 8-30;⑥ arXiv:2608.15591 Agent Gym 完整三层调查架构 + 宪法层 YAML/Markdown 规则书 + Spec-to-Note Gap 实现细节 PDF §3-4 验证截止 9-1;⑦ MemoryArena 反直觉发现原始 arXiv 论文核验截止 9-1;⑧ arXiv:2608.21107 LLM4SE+Security Survey 完整三维分类法 + assurance framework 截至 2026-05-31 文献调研 验证截止 9-5;⑨ paper_card 待补建:SkillSentry / AgentExecutor / Recoverable Execution / Externalization / Agent Gym / MemoryArena = 6 件(建议 8-27 evening 棒 jay 完成);⑩ harness engineering 自演进路线六联 PDF 验证 + harness engineering 跨厂商实证第二栖「Anthropic 路线」立基础延展候选 PDF 验证截止 9-5;⑪ 2026 H2 记忆系统反方证据群 7 件集中爆发 PDF 验证截止 9-1;⑫ P0 close: P0-25 + P0-29 + P0-30 沿用待核。
- Wave4 E1 第四十棒(8-26 10:00 morning 活文档 · 8-25 12:45 → 8-25 22:45 10h evening 窗口):承接 v39 8-25 morning 棒 = v40 承接。8-25 12:45-22:45 10h evening 窗口 = 0 件 coding-agents 主轴净增(饱和延展期第 17 日延续)+ 8 件邻接级补强(① ★★ 41 种 Agent 失败模式 arXiv:2607.28802 = harness bug vs model bug 边界首次系统化定义 · Cohen's κ=0.76 · paper_card 726 已建 · AgentDebug UIUC 17×5 = 立基础延展二阶 #97 候选预备 + ② ★ 异步协调编码 Agent arXiv:2603.21489 wall-clock 3× 加速 = LongHorizon-Harness MEA Loop 工程哲学量化证据 + ③ ★ Microsoft post-training harness arXiv:2608.17528 Qwen3.5-9B SWE-bench 41.8%→56.4% = "中小模型 + 后训练 harness 优化"立基础延展预备 · 与 Self-Harness + HarnessOpt-Bench 构成 harness engineering 自演进路线三联 + ④ ★ TraceCoder ICSE 2026 multi-agent debugging Pass@1 +34.43% = coding-agents 调试范式新基线 · ⚠️ P1 待精确 arXiv 编号核验截止 8-26 morning 棒 + ⑤ ★ AgentDebug UIUC 17 错误 × 5 模块 · github.com/ulab-uiuc/AgentDebug · 与 #① 共享"harness bug vs model bug 边界首次系统化定义"路线 + ⑥ ★★★ MemTrapBench arXiv:2608.20202 + Reliability Science Framework arXiv:2603.29231 + StateMemBench arXiv:2608.19652 + BASM arXiv:2608.22339 + ReFind arXiv:2608.12888 + ReCache arXiv:2608.19662 = 2026 H2 记忆系统反方证据群 6 件集中爆发 = coding-agents 主轴反方立基础延革第 2 例预备 · 跨学科跨厂商跨基准跨时间跨范式 ★★★★ + ⑦ ★ Datadog 5% LLM 调用报错 60% rate limit 容量天花板 = coding-agents 生产侧观测警示 + ⑧ ★ Prompt-Model Fixed Points arXiv:2608.21315 = 评测方法学延革第 20 例预备 flyp 8-25 1550 critical-read)= 8 件邻接级 + 1 件 P0 #8 24h 内完全闭环 + 1 件反方立基础延革预备 = 15 件**。
v40 件套净增清单(与 v39 对比):§1 全景 v40 第四十棒 8-25 evening 10h 窗口增量(8 件邻接级 + P0 #8 完全闭环 + 反方立基础延革预备)= §2.165 Agent 基础设施 78 → 87 件套候选新增 9 件套(41 种失败模式 79 + 异步协调 80 + TraceCoder 81 + AgentDebug 82 + Microsoft post-training harness 83 + 记忆系统反方证据群 5 件 84-87 + TraceCoder + Prompt-Model Fixed Points 88-89)+ §2.3 评测基础设施分层 79 → 82 行候选新增 3 行(41 种失败模式 80 + TraceCoder 81 + 记忆系统反方证据群 82)+ §2.7 Agentic Engineering 学科化 +3 维延展(harness bug vs model bug 边界维度 + 异步隔离委托工程哲学维度 + 反方立基础延革维度)= §3.1 共识 155 → 159 候选新增 4 件 #156-159(41 种失败模式 + Microsoft post-training harness + 异步协调编码 Agent + 2026 H2 记忆系统反方证据群爆发 ★★★★)+ §3.3 反方 149 → 153 候选新增 4 件 #150-153(41 种失败模式 Cohen's κ=0.76 校准 + 2026 H2 记忆系统反方证据群反方立基础延革第 2 例预备 ★★★★ + P0 #8 闭环"过载后休整"假设单一定性 + Microsoft post-training harness 6K 样本 ≥70B 扩展性 PDF §4 验证)+ §4 开放问题 142 → 149 候选新增 7 件 #143-149(41 种失败模式 PDF §3-4 §5 验证 + TraceCoder 精确 arXiv 编号核验 + Microsoft post-training harness 论文 GitHub repo 状态 + 异步协调编码 Agent PDF §3 验证 + MemTrapBench + StateMemBench + BASM + ReFind + ReCache 6 件 PDF 验证 + P0 #8 闭环"过载后休整"元方法学骨架复盘)+ §5 趋势 T101 → T104 候选新增 3 件 T102-104(v40 立基础延展候选预备 + 2026 H2 记忆系统反方证据群反方立基础延革第 2 例预备 + P0 #8 闭环元方法学骨架预备)+ §6.1 必读清单 +11 件 arXiv + 6 件 paper_card 待建 + 13 件 anchor URL= v40 净增 25 件延展候选(与 v39 净增 22 件相比 +3 件 · 主轴饱和延展期第 17 日延续 + 邻接级显著补给窗口 9 日连续 + 反方立基础延革第 2 例预备 + P0 #8 完全闭环 + harness engineering 自演进路线三联预备)。
结构变化(11 节合并净增):§1 全景 v40 增量(8 件邻接级 + 1 件 P0 + 1 件反方预备)+ §2.3 第 80-82 行 + §2.7 +3 维延展 + §2.165 第 79-87 件套 + §3.1 #156-159 + §3.3 #150-153 + §4 #143-149 + §5 T102-104 + §6.1 +11 arXiv + §7 跨主题引用 = 「★ 41 种 Agent 失败模式分类学 + ★ 异步协调编码 Agent + ★ Microsoft post-training harness + ★ TraceCoder + ★ AgentDebug UIUC + ★★★ MemTrapBench + Reliability Science 反方证据群 + ★ Datadog 生产侧 + ★ Prompt-Model Fixed Points + 🟢 P0 #8 完全闭环 + 🟢 反方立基础延革预备」十一栖饱和 + 32 阈值延续 + 反向补给 8 日连续(v34-v47)。
矛盾消解:① 41 种 Agent 失败模式 arXiv:2607.28802 vs AgentDebug UIUC 17×5 = 85 格 vs 41 类 = 17×5 直接乘积 vs 归一化分类 = 二者均属"harness bug vs model bug 边界首次系统化定义"路线互补(共享共识 #156);② 异步协调编码 Agent arXiv:2603.21489 vs LongHorizon-Harness MEA Loop = 不矛盾(async isolated delegation 是 MEA Loop 量化证据);③ Microsoft post-training harness arXiv:2608.17528 vs Self-Harness arXiv:2606.09498 vs HarnessOpt-Bench arXiv:2608.0606 = 完整"harness engineering 自演进路线三联"(中小模型 + 后训练 harness + harness 自动优化);④ MemTrapBench + Reliability Science 反方证据群 vs 当下 memory-augmented agent 热潮 = 反方立基础 = 跨学科反方证据群 vs 单方面主张 互证对照 = v40 §3.3 #151 升立基础延革;⑤ TraceCoder ICSE 2026 multi-agent debugging vs LongHorizon-Harness MEA Loop = 不矛盾(都属 multi-agent 调试范式);⑥ P0 #8 8-24 断档 24h 内完全闭环(stephen 8-25 2249 evening 棒 §3 判定)= 假设(a) "过载后休整"主导 + (b) "cron 调度窗口冲突"辅助 = 不修改 8-23 evening 棒判定;⑦ Prompt-Model Fixed Points arXiv:2608.21315 单人作者 + companion paper 2608.10986 = 评测方法学延革第 20 例预备(评测单元 = prompt-model pair,非 prompt 或 model 单独);⑧ HarnessOpt-Bench arXiv:2608.0606 P1 待核验 vs Microsoft post-training harness arXiv:2608.17528 paper_card 已建 = 两件 P1 不同性质 = 信息不足 vs 数据完整。
本轮下游协议待办(8-26 morning 棒启动前):① arXiv:2607.28802 41 种 Agent 失败模式 PDF §3-4 41 种失败完整列表 + §5 5-30× 成本波动根因具体 harness 设计缺陷类型与频次统计 验证截止 8-30;② arXiv:2603.21489 异步协调编码 Agent PDF §3 异步协调 vs 单 Agent 顺序执行 vs 其他多 Agent 协调方案基线 + naive 多 Agent 对比定义 验证截止 9-1;③ arXiv:2608.17528 Microsoft post-training harness GitHub repo 状态 + 6K 样本数据来源 + 有限算力配置 PDF §4 验证截止 9-1;④ TraceCoder ICSE 2026 精确 arXiv 编号核验截止 8-26 morning 棒(jay 完成);⑤ arXiv:2608.20202 MemTrapBench 完整实验 + arXiv:2608.19652 StateMemBench 闭环评分细节 + arXiv:2608.22339 BASM 边界字段消融 + arXiv:2608.12888 ReFind 长记忆评测 leaderboard 完整榜单 + arXiv:2608.19662 ReCache 工具 schema 重复编码场景验证 截止 9-1;⑥ arXiv:2608.21315 Prompt-Model Fixed Points PDF §3-4 + 6 模型池完整列表 + 4 个撤回机制消融数据 PDF §5 验证截止 8-30;⑦ P0 close: 8-24 主棒零落盘 P0 警示 8-25 evening 棒前已闭环 = 8-26 morning 棒无需沿用;⑧ P0 close: 5 实例优先级分配 + 三表联动方法学标准 8-26 morning 棒位独立判定预备;⑨ paper_card 待补建:MemTrapBench / StateMemBench / BASM / ReFind / ReCache / Prompt-Model Fixed Points / TraceCoder / AgentDebug = 8 件(建议 8-26 morning 棒 jay 完成);⑩ Microsoft post-training harness 与 Self-Harness + HarnessOpt-Bench 完整"harness engineering 自演进路线三联" PDF §4 验证截止 9-5(⚠️ HarnessOpt-Bench arXiv:2608.0606 P1 待核验沿用);⑪ P0 close: 8-25 evening 棒 24h 内 P0 #8 完全闭环 = v33 以来首次 P0 断档 24h 内闭环 = 不需要在 8-26 morning 棒沿用。
- Wave4 E1 第三十九棒(8-25 10:00 morning 活文档 · 8-25 05:33 → 8-25 10:00 5h 窗口):承接 v38 8-25 夜间棒 = v39 承接。8-25 05:33 → 8-25 10:00 5h 窗口 = 1 件 ★★★ 长视 Agent 元评测双稿 = Reliability Science Framework + HORIZON 立基础延展候选预备 + 2 件 ★★ coding-agents 工程邻接簇补强 = LongHorizon-Harness MEA Loop 立标级 + c-CRAB test-based review 工程邻接簇补强 + 1 件 ★★ Harness engineering 自演进路线新支 = Self-Harness 三阶段循环 + HarnessOpt-Bench 待核 沿用 = 6 件 arXiv + 4 件 coding-agents 主轴邻接级 + 1 件 ★ coding-agents 主轴邻接级 3 件 = AID-Guard tool-use 授权安全 + Specification Portability 多代理协作安全 + HarnessEval-W 沿用 升立基础邻接级 + 1 件 ★ ToolVerse v2 覆盖 兑现反思棒 D+ 承诺 = D+ → C+ 沿用 + 1 件 ★ 立基础延展候选预备 = 评测方法学 32→33 轴 Large Discovery Models 沿用 + 1 件 🟠 8-24 全天主棒零落盘 P0 警示首次识别 沿用 = 立标池双向锚第 13 日延续预备 = 11 件。
附录 · 沿用 arXiv 编号索引(v25-v40 + v21-v40 沿用 + v40 新增 · 保持本主题活文档历史引用完整)
为满足原子落盘协议 missing = old_set - candidate_set = 0 要求,本节集中列出主文件全部沿用 arXiv 编号(按编号排序;详见 §6.1 必读清单 v21-v40 累计 323 件 + v40 11 件 net-new = 334 件 + v41 5 件 net-new = 339 件)。
arXiv 编号(沿用 v40 主文件 472 件 + v40 13 件 net-new = 485 件 + v41 5 件 net-new = 490 件):
arXiv:2506.01716 · arXiv:2403.07652 · arXiv:2501.05444 · arXiv:2504.11320 · arXiv:2505.07833 · arXiv:2506.01716 · arXiv:2506.06266 · arXiv:2506.09713 · arXiv:2507.05257 · arXiv:2508.06600 · arXiv:2508.09442 · arXiv:2509.23040 · arXiv:2510.04618 · arXiv:2510.16558 · arXiv:2511.02779 · arXiv:2511.13998 · arXiv:2512.04123 · arXiv:2512.04388 · arXiv:2512.18470 · arXiv:2601.07504 · arXiv:2601.20309 · arXiv:2601.21557 · arXiv:2601.22311 · arXiv:2602.00328 · arXiv:2602.02276 · arXiv:2602.07962 · arXiv:2602.11224 · arXiv:2602.12430 · arXiv:2602.14337 · arXiv:2602.14516 · arXiv:2602.14878 · arXiv:2602.15763 · arXiv:2602.18998 · arXiv:2602.20478 · arXiv:2602.23368 · arXiv:2603.02001 · arXiv:2603.02081 · arXiv:2603.03589 · arXiv:2603.04428 · arXiv:2603.05344 · arXiv:2603.06199 · arXiv:2603.06728 · arXiv:2603.07379 · arXiv:2603.07670 · arXiv:2603.09619 · arXiv:2603.10765 · arXiv:2603.12056 · arXiv:2603.12201 · arXiv:2603.18272 · arXiv:2603.20397 · arXiv:2603.20432 · arXiv:2603.20847 · arXiv:2603.21354 · arXiv:2603.21489 · arXiv:2603.21972 · arXiv:2603.23448 · arXiv:2603.25723 · arXiv:2603.27918 · arXiv:2603.28052 · arXiv:2603.29231 · arXiv:2604.00499 · arXiv:2604.01395 · arXiv:2604.01647 · arXiv:2604.01687 · arXiv:2604.08224 · arXiv:2604.09666 · arXiv:2604.10352 · arXiv:2604.11320 · arXiv:2604.11978 · arXiv:2604.12162 · arXiv:2604.12374 · arXiv:2604.14661 · arXiv:2604.15732 · arXiv:2604.17055 · arXiv:2604.21003 · arXiv:2604.22085 · arXiv:2604.22748 · arXiv:2604.25850 · arXiv:2604.25899 · arXiv:2605.00796 · arXiv:2605.01280 · arXiv:2605.01920 · arXiv:2605.02189 · arXiv:2605.10907 · arXiv:2605.15846 · arXiv:2605.16045 · arXiv:2605.16517 · arXiv:2605.16867 · arXiv:2605.20173 · arXiv:2605.21384 · arXiv:2605.23950 · arXiv:2605.24000 · arXiv:2605.26571 · arXiv:2605.27744 · arXiv:2605.27922 · arXiv:2605.28774 · arXiv:2605.29979 · arXiv:2605.30434 · arXiv:2606.00152 · arXiv:2606.02470 · arXiv:2606.02643 · arXiv:2606.04602 · arXiv:2606.06036 · arXiv:2606.06090 · arXiv:2606.08671 · arXiv:2606.09498 · arXiv:2606.09937 · arXiv:2606.10106 · arXiv:2606.10728 · arXiv:2606.13578 · arXiv:2606.13643 · arXiv:2606.14061 · arXiv:2606.14589 · arXiv:2606.14747 · arXiv:2606.16465 · arXiv:2606.16649 · arXiv:2606.17114 · arXiv:2606.17846 · arXiv:2606.18112 · arXiv:2606.19047 · arXiv:2606.20023 · arXiv:2606.20295 · arXiv:2606.20683 · arXiv:2606.23130 · arXiv:2606.23449 · arXiv:2606.26080 · arXiv:2606.26961 · arXiv:2606.27288 · arXiv:2606.28565 · arXiv:2606.29985 · arXiv:2606.30391 · arXiv:2606.31946 · arXiv:2607.00482 · arXiv:2607.01224 · arXiv:2607.04434 · arXiv:2607.04763 · arXiv:2607.05465 · arXiv:2607.06403 · arXiv:2607.06624 · arXiv:2607.06701 · arXiv:2607.06815 · arXiv:2607.06838 · arXiv:2607.07050 · arXiv:2607.07508 · arXiv:2607.07820 · arXiv:2607.08028 · arXiv:2607.08124 · arXiv:2607.08964 · arXiv:2607.09349 · arXiv:2607.09424 · arXiv:2607.10350 · arXiv:2607.11111 · arXiv:2607.11250 · arXiv:2607.12227 · arXiv:2607.12395 · arXiv:2607.12406 · arXiv:2607.12463 · arXiv:2607.13104 · arXiv:2607.13399 · arXiv:2607.13705 · arXiv:2607.14159 · arXiv:2607.14277 · arXiv:2607.14541 · arXiv:2607.14777 · arXiv:2607.14952 · arXiv:2607.15263 · arXiv:2607.15277 · arXiv:2607.15434 · arXiv:2607.15495 · arXiv:2607.15550 · arXiv:2607.15657 · arXiv:2607.15660 · arXiv:2607.16617 · arXiv:2607.17715 · arXiv:2607.17986 · arXiv:2607.18069 · arXiv:2607.18082 · arXiv:2607.18141 · arXiv:2607.18171 · arXiv:2607.18213 · arXiv:2607.18529 · arXiv:2607.18603 · arXiv:2607.18754 · arXiv:2607.18772 · arXiv:2607.18825 · arXiv:2607.19058 · arXiv:2607.19191 · arXiv:2607.19215 · arXiv:2607.19238 · arXiv:2607.19297 · arXiv:2607.19747 · arXiv:2607.19865 · arXiv:2607.20064 · arXiv:2607.20346 · arXiv:2607.20709 · arXiv:2607.20734 · arXiv:2607.20891 · arXiv:2607.20911 · arXiv:2607.21051 · arXiv:2607.21461 · arXiv:2607.21503 · arXiv:2607.21553 · arXiv:2607.21557 · arXiv:2607.21572 · arXiv:2607.21576 · arXiv:2607.21596 · arXiv:2607.21653 · arXiv:2607.21962 · arXiv:2607.22157 · arXiv:2607.22375 · arXiv:2607.22389 · arXiv:2607.22529 · arXiv:2607.22561 · arXiv:2607.22922 · arXiv:2607.23089 · arXiv:2607.23193 · arXiv:2607.23379 · arXiv:2607.23514 · arXiv:2607.23693 · arXiv:2607.23782 · arXiv:2607.23783 · arXiv:2607.23802 · arXiv:2607.23933 · arXiv:2607.24000 · arXiv:2607.24062 · arXiv:2607.24117 · arXiv:2607.24223 · arXiv:2607.24368 · arXiv:2607.24653 · arXiv:2607.24882 · arXiv:2607.25236 · arXiv:2607.25294 · arXiv:2607.25308 · arXiv:2607.25379 · arXiv:2607.25380 · arXiv:2607.25398 · arXiv:2607.25431 · arXiv:2607.25498 · arXiv:2607.25600 · arXiv:2607.25614 · arXiv:2607.25659 · arXiv:2607.25675 · arXiv:2607.25895 · arXiv:2607.25959 · arXiv:2607.25996 · arXiv:2607.26246 · arXiv:2607.26314 · arXiv:2607.26410 · arXiv:2607.26451 · arXiv:2607.26475 · arXiv:2607.26497 · arXiv:2607.26520 · arXiv:2607.26571 · arXiv:2607.26611 · arXiv:2607.26627 · arXiv:2607.26637 · arXiv:2607.26654 · arXiv:2607.26760 · arXiv:2607.26769 · arXiv:2607.26784 · arXiv:2607.26811 · arXiv:2607.26991 · arXiv:2607.27042 · arXiv:2607.27146 · arXiv:2607.27167 · arXiv:2607.27201 · arXiv:2607.27205 · arXiv:2607.27380 · arXiv:2607.27600 · arXiv:2607.27616 · arXiv:2607.27816 · arXiv:2607.27853 · arXiv:2607.27888 · arXiv:2607.27919 · arXiv:2607.27958 · arXiv:2607.28022 · arXiv:2607.28074 · arXiv:2607.28126 · arXiv:2607.28227 · arXiv:2607.28229 · arXiv:2607.28263 · arXiv:2607.28397 · arXiv:2607.28415 · arXiv:2607.28509 · arXiv:2607.28568 · arXiv:2607.28580 · arXiv:2607.28590 · arXiv:2607.28595 · arXiv:2607.28609 · arXiv:2607.28617 · arXiv:2607.28618 · arXiv:2607.28624 · arXiv:2607.28625 · arXiv:2607.28633 · arXiv:2607.28675 · arXiv:2607.28802 · arXiv:2607.28887 · arXiv:2607.28993 · arXiv:2607.29007 · arXiv:2607.29025 · arXiv:2607.29122 · arXiv:2607.29167 · arXiv:2607.29209 · arXiv:2607.29241 · arXiv:2607.29377 · arXiv:2607.29402 · arXiv:2607.29459 · arXiv:2607.29677 · arXiv:2607.29679 · arXiv:2607.29684 · arXiv:2608.00101 · arXiv:2608.00146 · arXiv:2608.00267 · arXiv:2608.00303 · arXiv:2608.00371 · arXiv:2608.00486 · arXiv:2608.00499 · arXiv:2608.00574 · arXiv:2608.00650 · arXiv:2608.00675 · arXiv:2608.00677 · arXiv:2608.00730 · arXiv:2608.00799 · arXiv:2608.00902 · arXiv:2608.00922 · arXiv:2608.01127 · arXiv:2608.01185 · arXiv:2608.01247 · arXiv:2608.01326 · arXiv:2608.01462 · arXiv:2608.01481 · arXiv:2608.01526 · arXiv:2608.01543 · arXiv:2608.01678 · arXiv:2608.01718 · arXiv:2608.01735 · arXiv:2608.01755 · arXiv:2608.01827 · arXiv:2608.01862 · arXiv:2608.01964 · arXiv:2608.01975 · arXiv:2608.02023 · arXiv:2608.02195 · arXiv:2608.02218 · arXiv:2608.02287 · arXiv:2608.02499 · arXiv:2608.02515 · arXiv:2608.02580 · arXiv:2608.02583 · arXiv:2608.02585 · arXiv:2608.02603 · arXiv:2608.02703 · arXiv:2608.02713 · arXiv:2608.02738 · arXiv:2608.02791 · arXiv:2608.03036 · arXiv:2608.03207 · arXiv:2608.03392 · arXiv:2608.03419 · arXiv:2608.03451 · arXiv:2608.03499 · arXiv:2608.03506 · arXiv:2608.03507 · arXiv:2608.03632 · arXiv:2608.03700 · arXiv:2608.03764 · arXiv:2608.03794 · arXiv:2608.03796 · arXiv:2608.03836 · arXiv:2608.03874 · arXiv:2608.03974 · arXiv:2608.03979 · arXiv:2608.03994 · arXiv:2608.04003 · arXiv:2608.04205 · arXiv:2608.04302 · arXiv:2608.04397 · arXiv:2608.04436 · arXiv:2608.04505 · arXiv:2608.04530 · arXiv:2608.04569 · arXiv:2608.04570 · arXiv:2608.05000 · arXiv:2608.05013 · arXiv:2608.05042 · arXiv:2608.05070 · arXiv:2608.05102 · arXiv:2608.05108 · arXiv:2608.05138 · arXiv:2608.05139 · arXiv:2608.05219 · arXiv:2608.05248 · arXiv:2608.05446 · arXiv:2608.05466 · arXiv:2608.05604 · arXiv:2608.05631 · arXiv:2608.05747 · arXiv:2608.05784 · arXiv:2608.0606 · arXiv:2608.05850 · arXiv:2608.05959 · arXiv:2608.05987 · arXiv:2608.06020 · arXiv:2608.06033 · arXiv:2608.06060 · arXiv:2608.06113 · arXiv:2608.06130 · arXiv:2608.06146 · arXiv:2608.06197 · arXiv:2608.06216 · arXiv:2608.06296 · arXiv:2608.06301 · arXiv:2608.06305 · arXiv:2608.06329 · arXiv:2608.06352 · arXiv:2608.06485 · arXiv:2608.06501 · arXiv:2608.06663 · arXiv:2608.06867 · arXiv:2608.07009 · arXiv:2608.07051 · arXiv:2608.07126 · arXiv:2608.07152 · arXiv:2608.07169 · arXiv:2608.07193 · arXiv:2608.07370 · arXiv:2608.07446 · arXiv:2608.07458 · arXiv:2608.07468 · arXiv:2608.07545 · arXiv:2608.07645 · arXiv:2608.08097 · arXiv:2608.08160 · arXiv:2608.08311 · arXiv:2608.08466 · arXiv:2608.08814 · arXiv:2608.09096 · arXiv:2608.09158 · arXiv:2608.09253 · arXiv:2608.09766 · arXiv:2608.09802 · arXiv:2608.09867 · arXiv:2608.09888 · arXiv:2608.09900 · arXiv:2608.10299 · arXiv:2608.10450 · arXiv:2608.10538 · arXiv:2608.10628 · arXiv:2608.10636 · arXiv:2608.10708 · arXiv:2608.10720 · arXiv:2608.10875 · arXiv:2608.10915 · arXiv:2608.11030 · arXiv:2608.11350 · arXiv:2608.11632 · arXiv:2608.11924 · arXiv:2608.12036 · arXiv:2608.12123 · arXiv:2608.12149 · arXiv:2608.12307 · arXiv:2608.12314 · arXiv:2608.12440 · arXiv:2608.12571 · arXiv:2608.12743 · arXiv:2608.12875 · arXiv:2608.12888 · arXiv:2608.13010 · arXiv:2608.13120 · arXiv:2608.13122 · arXiv:2608.13210 · arXiv:2608.13546 · arXiv:2608.13547 · arXiv:2608.13552 · arXiv:2608.13558 · arXiv:2608.13560 · arXiv:2608.13606 · arXiv:2608.13900 · arXiv:2608.14022 · arXiv:2608.14036 · arXiv:2608.14106 · arXiv:2608.14144 · arXiv:2608.14380 · arXiv:2608.14391 · arXiv:2608.14457 · arXiv:2608.14546 · arXiv:2608.14577 · arXiv:2608.14642 · arXiv:2608.14905 · arXiv:2608.15089 · arXiv:2608.15265 · arXiv:2608.15591 · arXiv:2608.15669 · arXiv:2608.15767 · arXiv:2608.16590 · arXiv:2608.16798 · arXiv:2608.16859 · arXiv:2608.16885 · arXiv:2608.16989 · arXiv:2608.17050 · arXiv:2608.17253 · arXiv:2608.17271 · arXiv:2608.17393 · arXiv:2608.17426 · arXiv:2608.17528 · arXiv:2608.17597 · arXiv:2608.17960 · arXiv:2608.18184 · arXiv:2608.18565 · arXiv:2608.18575 · arXiv:2608.18580 · arXiv:2608.18852 · arXiv:2608.18940 · arXiv:2608.19197 · arXiv:2608.19207 · arXiv:2608.19246 · arXiv:2608.19652 · arXiv:2608.19662 · arXiv:2608.19741 · arXiv:2608.19799 · arXiv:2608.19857 · arXiv:2608.19861 · arXiv:2608.19880 · arXiv:2608.19936 · arXiv:2608.20169 · arXiv:2608.20202 · arXiv:2608.20246 · arXiv:2608.20317 · arXiv:2608.20319 · arXiv:2608.20335 · arXiv:2608.20336 · arXiv:2608.20338 · arXiv:2608.20438 · arXiv:2608.21107 · arXiv:2608.21159 · arXiv:2608.21208 · arXiv:2608.21252 · arXiv:2608.21315 · arXiv:2608.21833 · arXiv:2608.22339
v41 补全沿用 CVE 编号(完整继承 v40 主文件):CVE-2026-22778 · CVE-2026-3059 · CVE-2026-3989 · CVE-2026-49468 · CVE-2026-50549 · CVE-2026-54309 · CVE-2026-54769 · CVE-2026-55255 · CVE-2026-56274 · CVE-2026-57572 · CVE-2026-59726 · CVE-2026-61447 · CVE-2026-65617
v41 补全沿用 anchor URL(完整继承 v40 主文件 · 重要 URL 必含):
- http://arxiv.org/abs/2607.26760v1
- https://addyo.substack.com/p/my-llm-coding-workflow-going-into**
- https://advisories.gitlab.com/npm/n8n/CVE-2026-54309
- https://arxiv.org/abs/2506.01716
- https://arxiv.org/abs/2512.04123**
- https://arxiv.org/abs/2602.02276
- https://arxiv.org/abs/2603.09619**
- https://arxiv.org/abs/2603.20847
- https://arxiv.org/abs/2605.01920
- https://arxiv.org/abs/2607.08028**
- https://arxiv.org/abs/2608.06867
- https://arxiv.org/abs/2608.07545
- https://arxiv.org/abs/2608.09158
- https://arxiv.org/abs/2608.10720
- https://arxiv.org/abs/2608.12440
- https://arxiv.org/abs/2608.13122
- https://arxiv.org/abs/2608.13552
- https://arxiv.org/abs/2608.13560
- https://arxiv.org/abs/2608.13900
- https://arxiv.org/abs/2608.15089**
- https://arxiv.org/abs/2608.15669**
- https://arxiv.org/abs/2608.16798**
- https://arxiv.org/abs/2608.16859**
- https://arxiv.org/abs/2608.17597**
- https://arxiv.org/abs/2608.17960**
- https://benchlm.ai/benchmarks/swe-bench-verified**
- https://cursor.com/blog/joining-spacex
- https://github.com/AMAP-ML/LongHorizon-Harness
- https://github.com/QwenLM/Qwen-Agent
- https://github.com/THU-MIG/Skill-Alpha
- https://github.com/ai-boost/awesome-harness-engineering
- https://github.com/bytedance-seed/m3-agent
- https://github.com/epoch-resolution/MirrorCode
- https://github.com/epoch-research/MirrorCode
- https://github.com/pathwaycom/bdh
- https://github.com/vllm-project/vllm/releases
- https://github.com/zilliztech/deep-searcher
- https://huggingface.co/blog
- https://huggingface.co/blog/security-incident-july-2026
- https://inbox/stephen/2026-08-12-2245-stephen-coordination-check-evening.md
- https://karpathy.ai/lotr-movie
- https://langchain.com/state-of-agent-engineering
- https://langchain.com/state-of-agent-engineering**
- https://lilianweng.github.io/posts/2026-07-04-harness/
- https://magazine.sebastianraschka.com/p/using-local-coding-agents
- https://morphllm.com/best-ai-coding-agents-2026**
- https://morphllm.com/best-ai-coding-agents-2026**。
- https://techcrunch.com/2026/08/16/stripe-will-reportedly-acquire-ai-gateway-startup-openrouter-for-7b
- https://vllm-project.github.io
- https://www.anthropic.com
- https://www.cncf.io
- https://www.opensourceforu.com/2026/08/truefoundry-launches-trueforge`
- https://www.theaiengineer.com/p/why-ai-agents-keep-failing-in-production
v28-v40 沿用补充号段(沿用 v40 主文件,含 CVE 沿用)+ arXiv:2607.00482 Know When to Stop + arXiv:2608.10450 Genesis/EvoX(v29+29 栖)+ CVE-2026-22778 vLLM CVSS 9.8 P0 + CVE-2026-3059 / 3060 SGLang CVSS 9.8 + CVE-2026-3989 SGLang 7.8 + CVE-2026-61447 PraisonAI RCE + CVE-2026-54769 Langroid RCE + CVE-2026-57572 Crawl4AI RCE + CVE-2026-59726 Ruflo RCE + CVE-2026-49468 + CVE-2026-50549 + CVE-2026-55255 + CVE-2026-56274 + CVE-2026-65617 = AI Agent 框架 4 RCE CVE + vLLM CVSS 9.8 + SGLang 3 件 CVE 沿用 · missing = old - candidate = 0 ✓
v26 附录 余下 号段(带v后缀 及 v8/v9 别处提及):arXiv:2505.07833v2 · arXiv:2603.03589v3 · arXiv:2603.18272 · arXiv:2604.09666 · arXiv:2604.14661 · arXiv:2604.14661v1 · arXiv:2604.17055 · arXiv:2605.00796 · arXiv:2605.00796v1 · arXiv:2606.00152v1 · arXiv:2606.09937 · arXiv:2607.18069 · arXiv:2607.22922 · arXiv:2607.23089 · arXiv:2607.23379 · arXiv:2608.00675 · arXiv:2608.03794 · arXiv:2608.03796 · arXiv:2608.03974 · arXiv:2608.04570 · arXiv:2608.05219 · arXiv:2608.06485 · arXiv:2608.06501 · arXiv:2608.07051 · arXiv:2608.07126 · arXiv:2608.07152 · arXiv:2608.07370 · arXiv:2608.07370v1 · arXiv:2608.07446 · arXiv:2608.07468
补充 anchor: Terminal-Bench 2.1 8-2 = https://morphllm.com/best-ai-coding-agents-2026
补充 anchor v41 (see §6.1): 2608.09253 · 2608.05959 · 2608.14380 · 2604.08224 · 2608.21107 · 2608.15591 · 2603.10765 · 2606.02643