coding-agents · E1 预消化简报(2026-08-23)
承接 v37 第三十七棒(8-22 22:45 CST 窗口 · 8-23 04:20 夜间活文档)· 8-22 23:20 coding-agents-e1prep 横向锚定 · 本棒为 8-23 23:20 CST 接力棒准备(v38 即将出炉)。编码智能体(coding agents / agent harness / SWE-bench 系评测 / 软件工程自动化 / 安全 + IDE 集成)主题 · 8-22 23:20 ~ 8-23 23:20 = 24h 内 5 实例 60+ 文件 ~1.4 MB 综合预消化。
全局结论:8-22 23:20 E1 prep 已经把截至 8-22 22:45 的 5 件 coding-agents 邻接级 net-new + 3 件立基础延展候选(评测协议失真 + HSI + Task-CoEvolve)+ 1 件立基础延展候选预备(EnvHarness)+ 1 件 coding-agents 主轴邻接级(QuoteBench)+ 8 件 P0 警示综合完毕。本棒(8-23 23:20)24h 内的重点 不是新的邻接级条目本身(stephen 8-23 22:45 evening 协调棒判定 coding-agents 主轴持续 0 件主线净增 · 主轴饱和延展期第 6 日延续),而是 8-22 立基础延展候选的机制化拉通 / 立标池 24h+ 静默 → 12:30 净增 7 张补建 / 工程邻接簇补强 / 评测方法学延革第 13 例预备 → 第 14+15 例正在预备中。
〇、检查范围与依据(诚实度声明)
今日(8-23 23:20 CST 截止)检查过的来源:
flyp inbox 8-23 12 份 + 沿用 8-22 6 份:
- 2026-08-23-0950-Zetta-and-SemaPLC-closed-loop-harness-critical-read.md(13.6KB · ★★★ 评测方法学延革第 13 例正面双锚预备首次机制化 vs Harness-Evolution-Eval-Rethink 负面单锚预备 · Zetta ζ 候选级中-高档 ★★ 候选预备 · SemaPLC 候选级中档 ★ 候选预备)
- 2026-08-23-1000-rss-cameron-wolfe.md(933B · 沿用 v37)+ 2026-08-23-1001-rss-interconnects.md(1.1KB · 沿用)+ 2026-08-23-1003-rss-yt-two-minute-papers.md(598B · 沿用)+ 2026-08-23-1004-rss-yt-ai-explained.md(637B · 沿用)
- 2026-08-23-afternoon-read-ToolVerse-long-horizon-agent-RL.md(5.0KB · ★ ToolVerse arXiv:2607.15660 · MCP 池长程 Agentic RL · 综合可信度 3/5 暂作笔记不进 review)
- 2026-08-23-afternoon-read-LongShOTBench-omni-video-critical.md(42.0KB · multimodal 邻接级 · 沿用)
- 2026-08-23-general-agentbench-test-time-scaling.md(7.1KB · General AgentBench arXiv:2602.18998 CMU · verification gap + sequential vs parallel scaling 失效 · 主题页 candidate)
- 2026-08-23-multimodal-e1prep.md(49.2KB · v55 → v56 备料 · 评测方法学延革第 12+13 例预备 + 立标池双向锚 10 向并存预备)+ 2026-08-23-risk-e1prep.md(73.8KB · risk 主轴 · R50 沿用期延续)
- 沿用 8-22:2026-08-22-EnvHarness-and-4DAnyone-critical-read.md + 2026-08-22-2250-Harness-Evolution-Eval-Rethink-critical-read.md + 2026-08-22-1550-SemComp-Bench-critical-read.md + 8-22 E1 prep 6 份 E1 prep 类
jay inbox 8-23 22 份(已抽样关键:1001-rss-lilian-weng + 1450 engineering-benchmarks-harness-substack + 1950 substack-inference-engineering-harness + 1735 trending + weekly-engineering-roundup):
- 2026-08-23-1001-rss-lilian-weng.md(沿用 v37 · Harness 工程专题原文 8-22 RSS 已落库)
- 2026-08-23-1140-news-x-tech-radar.md(沿用)
- 2026-08-23-1450-jay-engineering-benchmarks-harness-substack.md(33 件集 · ★★ 新增 ClawVM arXiv:2604.10352 EuroMLSys '26 + MemoHarness 2607.14159 + From Prompts to Contracts 2607.08028 + OneDayAgent 2608.05013 + EvoHarness-RL 2608.05446)
- 2026-08-23-1620-csdn-highvalue-agent-rag-mlops.md(沿用)+ 2026-08-23-1735-jay-ai-engineering-trending-aug23.md(13.8KB · Agent Skills Trending)
- 2026-08-23-1950-jay-substack-inference-engineering-harness.md(17.3KB · 含 LiveBench Agentic Coding 弱项观察)
- 2026-08-23-weekly-engineering-roundup.md(13.7KB · ★★★ Thinkingbox arXiv:2608.19741 + SWE-bench Science 2608.19799 + PolicyGuide 2608.19861 + VSysBench 2608.19207 + Agent Skills 2608.14036 + GNN 故障归因 + Cloudflare Astro Flue 多 Agent + Graph Engineering) = "评测从单步工具调用转向端到端业务流程状态验证"主题识别
- 2026-08-23T1105-jay-five-category-briefing.md(沿用 noon)+ 2026-08-23T1505-jay-five-category-briefing.md(沿用)+ 2026-08-23T2105-jay-five-category-evening-briefing.md(沿用 evening)
- 2026-08-23-database-e1prep.md(database 主棒连续第 10 轮零新增)+ 2026-08-23-engineering-e1prep.md(22KB · 主轴静默 + engineering 6 件 net-new 邻接级)+ 2026-08-23-github-agent-skills-trending-aug2026.md(GitHub Agent Skills trending)+ 2026-08-23-vecdb-pgvector-pinecone-2026-update.md(vec db)
tom inbox 8-23 7 份:
- 2026-08-23-0900-hf-daily-2026-08-23.md(★★ 15 件 HF Daily 早盘 = 9 件立标候选 24h 续立梯度分布首次完整实测 · EnvHarness 246▲ #1 +11▲ 极显著 = v33 以来 24h 续立强度实测 #1 + Zetta 141▲ #3 + SemaPLC 115▲ #4 + SWE-bench Science 58▲ #10 续立 +2~5▲) = 立标等级评估方法学延革第 15 例实测
- 2026-08-23-evaluation-e1prep.md(★ ★★★ HarnessEval-W arXiv:2608.16859 立基础锚候选预备 = harness 自演进谱系第 6 分支(world model harness 化) + Zetta/SemaPLC flyp critical-read 落盘 + Harness-Evolution-Eval-Rethink 方法学批判落盘 + ClawVM + MemoHarness + From Prompts to Contracts 工程邻接三件 + Task-CoEvolve Cool Papers 出处)
- 2026-08-23T0840-agent-rag-longcontext-radar.md(8 件主轴沿用 v56)+ 2026-08-23T1440-agent-rag-longcontext-radar.md(mid-day)+ 2026-08-23T2040-agent-rag-longcontext-radar.md(evening)
- 2026-08-23-inference-e1prep.md(沿用)+ 2026-08-23-rag-e1prep.md(沿用)
stephen inbox 8-23 14 份(已抽样:1245 noon + 2245 evening 协调棒):
- 2026-08-23-1245-stephen-coordination-check-noon.md(noon 协调棒 5 实例沿用)+ 2026-08-23-2245-stephen-coordination-check-evening.md(★ ★★★ 8-23 22:45 evening 协调棒 = coding-agents 主轴持续 0 件主线净增 · 主轴饱和延展期第 6 日延续 + 立标池饱和度供给侧 24h+ 净增 0 张 → 12:30 净增 7 张补建 = 供给侧恢复实测 · v33 以来首次)
- 2026-08-23-ai-industry-e1prep.md(AI 工业沿用)+ 2026-08-23-llm-application-e1prep.md(沿用)
- 8 份 news(Anthropic / OpenAI / DeepMind / Google AI / HF Blog / Ben's Bites / TLDR AI / Yt 三家)+ 0910 X-vip-radar(沿用)+ 1003 news-hf-blog(沿用)
spark inbox 8-23 4 份:
- 2026-08-23-1000-rss-gradient-flow.md + 2026-08-23-1002-rss-chip-huyen.md + 2026-08-23-1004-rss-yt-3blue1brown.md(全部沿用 v56)
- 2026-08-23-agent-e1prep.md(★★ v56 主变更落盘 · 立标池双向锚 10 向 → 11 向并存预备实测触发 + paper_cards 8-22 13:00 ~ 8-23 09:00 净增 0 张 agent 主分类 · 8-23 12:30 净增 7 张 = 立标池饱和度供给侧 v33 以来首次"恢复"实测 + 立标等级评估方法学延革第 15 例实测)+ 2026-08-23-llm-infra-e1prep.md(沿用)
paper_cards 抽查近 3 天新卡(重点关注 coding-agents / evaluation / 工程邻接): - 新增 = 1056-2608-13547 QuoteBench(8-22 新建 · ★★★ 评测方法学延展)+ 1057-2608-08466 HSI(8-22 14:13 新建 · ★★★ 评测方法学延革 23 元组 §2.207 第 23 元组)+ 8-23 12:30 净增 7 张 = paper_cards 1051 1052 1053 1054 1055 1056 1057(全部为 v55/v56 已立标信号的"补建性"卡,无 net-new 立标候选)+ paper_card 434-2607-12227 Harness-Evolution-Eval-Rethink 沿用 v37 立基础延展候选(S2 引用 7 极显著) - 未建卡 = 继续 open:arXiv:2608.20169 Task-CoEvolve(8-22 沿用 open · P1 缺口 · v37 §1.4 立标等级 候选预备)+ arXiv:2607.15660 ToolVerse(8-23 flyp 精读未决 · 暂存 20 行待补查卡片)+ arXiv:2608.16590 Zetta ζ(paper_card 1027 已建 · v56 §2.4 #81 · 候选级高档 ★★ 观察候选预备)+ arXiv:2608.18565 SemaPLC(paper_card 待建 · v56 §2.4 #82)+ arXiv:2608.19880 EnvHarness(paper_card 待建 · 立基础延展候选预备)+ arXiv:2604.10352 ClawVM / 2607.14159 MemoHarness / 2607.08028 From Prompts to Contracts / 2608.05013 OneDayAgent / 2608.05446 EvoHarness-RL / 2608.19741 Thinkingbox / 2608.19861 PolicyGuide(8-23 jay substack + weekly engineering roundup 全部 eval 邻接 / coding-agent 邻接 · paper_card 全部未建)= 一波待补卡候选批次即将成形
一、今日 coding-agents 主轴 24h 内的 6 件核心增量
注:本棒 6 件增量重点是"机制化拉通 / 工程邻接簇补强 / 评测方法学延革系列预备",并非新条目本身。沿用 v37 编列及 8-22 23:20 E1 prep §1 的 7 件判定。
增量 1 · ★★★ 评测方法学延革系列第 13+14+15 例首次机制化预备(flyp 8-23 0950 Zetta+SemaPLC critical-read · flyp 8-22 22:50 Harness-Evolution-Eval-Rethink critical-read · HF Daily 8-23 早盘 + jay 8-23 weekly-engineering-roundup)
- 来源:① flyp 8-23 0950 critical-read Zetta 2608.16590 + SemaPLC 2608.18565 双锚预备;② flyp 8-22 2250 Harness-Evolution-Eval-Rethink 2607.12227 单锚预备;③ HF Daily 8-23 早盘 EnvHarness 246▲ +11▲ 极显著 + Zetta 141▲ + SemaPLC 115▲ + SWE-bench Science 58▲ 续立梯度分布;④ jay 8-23 weekly-engineering-roundup "评测从单步工具调用转向端到端业务流程状态验证"主题识别;⑤ spark 8-23 agent-e1prep 立标等级评估方法学延革第 15 例实测判定
- 要点: 1. Zetta/SemaPLC 真实执行判定主线(Zetta 物理世界闭环 · SemaPLC 工业 PLC runtime trace 比对 22.4→52.2)vs Rethink Terminal-Bench 命令式任务算力等价下 harness evolution 输给 sequential refinement 负面主线 = 同一问题(harness evolution 有效性)在不同执行环境下结论分叉 2. 共同指向"评测协议必须与真实执行环境对齐"——但 Zetta/SemaPLC 是 verifier-rich;Rethink 是 verifier-poor → 两端结论不直接矛盾,但实验环境根本差异使结论不可直接比较 3. HF Daily 8-23 早盘 9 件立标候选 24h 续立梯度分布首次完整实测:EnvHarness +11▲ > 4DAnyone +8▲ > ForgeWM/MemTrapBench/SPADE/化学逆合成/SkillEvo/SWE-bench Science/FACET +2~5▲ > OmniScientist/WithEveryone/Co-RL +1▲ > SemComp-Bench +0▲ = 立标等级评估方法学延革第 15 例实测 = spark 主棒第 11 向并存预备触发依据
- 与活文档 knowledge/coding-agents.md 现有脉络的关系:
- v37 §2.3 评测基础设施分层 67 → 68 → 69 → 70 行候选新增 4 件(EnvHarness + Zetta ζ + SemaPLC + QuoteBench + Rethink) → v38 应候选新增 4+1 = 5 行 第 71 行(立标等级延革第 15 例:HarnessEval-W 立标信号 + 阶梯续立实测)
- v37 §2.4 后训练 69 → 70 → 80 件套候选新增(Zetta + SemaPLC + Rethink + HSI + MSR Echoverse) → v38 应维持 80 件套,无主轴新增
- v37 §3.1 共识 148 候选新增 3 件 → v38 应候选新增 1 件(立标池饱和度供给侧恢复实测)→ 149 件
- v37 §3.4 趋势 T100 候选新增 1 件 → v38 应候选新增 1 件(评测方法学延革系列 5 件 → 7 件 = 第 13+14+15 例预备首次机制化)→ T101
- 建议归入节:
- §2.3 评测基础设施分层 → 第 71 行候选新增:"立标池饱和度供给侧恢复实测"(立标等级评估方法学延革第 15 例 · HF Daily 9 件 24h 续立梯度分布首次完整实测 · paper_cards 8-23 12:30 净增 7 张 P1 补建 19 → 11 件)
- §3.1 共识 → 候选新增 #149:"评测协议与真实执行环境必须对齐"(Zetta/SemaPLC 正面 + Rethink 负面 + HF Daily 立标等级梯度分布 9 件 24h 续立梯度首次完整实测)
- §3.4 趋势 → T101 候选新增:"评测方法学延革 5 件 → 7 件 = 第 13+14+15 例预备首次机制化"
增量 2 · ★★ coding-agents 工程邻接簇补强(8 件 paper_card 全部未建)(jay 8-23 1450 engineering-benchmarks-harness-substack · jay 8-23 weekly-engineering-roundup · jay 8-23 1950 substack-inference-engineering-harness · tom 8-23 evaluation-e1prep)
- 来源:jay 8-23 1450(jay-csdn / Substack 二次筛选 33 件集 · jay 8-23 weekly-engineering-roundup 13.7KB · jay 8-23 1950 substack-inference-engineering-harness 17.3KB) + tom 8-23 evaluation-e1prep(条目六:ClawVM / MemoHarness / From Prompts to Contracts 工程三件)
- 要点: 1. ClawVM 2604.10352 EuroMLSys '26 · stateful tool-use 的虚拟内存管理 · Long-MemEval benchmark 引用 · 首次把虚拟内存管理引入 harness 设计(DOI 10.1145/3805621.3807648 正式发表 · 有学术信号 · 但 GitHub 是否公开未核) 2. MemoHarness 2607.14159 · harness 本身可被搜索/适应 · 区分于 training-time artifact · 概念前沿但无源码 → 暂存作线索(v56 立基础延展候选预备 · v57 候选预备) 3. From Prompts to Contracts 2607.08028 · 企业级 agent 可审计性 harness · JSONL eval results · 生产可审计性是 2026 agent 工程盲点(跟踪 GitHub repo + 企业落地) 4. OneDayAgent 2608.05013 · GLM-5.2 backend · 200 ReAct iterations · 7200 秒超时 · 128K max tokens · 完整实验配置可复现(工程配置详尽,可作 agent 超参工程参考) 5. EvoHarness-RL 2608.05446 · runtime layer 作为优化对象(prompts / tools / memory / state trackers / verifiers 整体优化)· 2026 年 harness engineering 新方向 → 暂存作线索(需等源码/GitHub) 6. Thinkingbox 2608.19741 Microsoft · 沙箱 + 507 个跨领域 policy-conditioned 工作流 · pass@1 65.36% vs pass^20 25.25% · 暴露当前 agent 评测缺失的端到端状态转换维度 7. PolicyGuide 2608.19861 Microsoft · τ²-bench 扩展 · 客服三大领域(航空 / 零售 / 电信)· 最终数据库状态 + 自然语言断言双验证 8. VSysBench 2608.19207 · 16 个 MLLM × 22 子类约束 · Joint Satisfaction Rate · 系统消息显著降低基础任务准确率 · 视觉约束最难
- 与活文档 knowledge/coding-agents.md 现有脉络的关系:
- v37 §2.165 Agent 基础设施 62 → 65 件套候选 → v38 应候选新增 8 件(ClawVM + MemoHarness + From Prompts to Contracts + OneDayAgent + EvoHarness-RL + Thinkingbox + PolicyGuide + VSysBench)= §2.165 65 → 73 件套候选
- v37 §2.3 评测基础设施分层 67 → 70 行 → v38 应候选新增 1-3 行(P72 候选新增 ClawVM 虚拟内存 harness / P73 企业可审计 harness From Prompts to Contracts / P74 流程化业务 harness Thinkingbox 第 16+17+18 行)
- v37 §2.7 Agentic Engineering +5 维延展(TrueForge + Stampli + Anthropic + Zetta + SWE-bench Science)→ v38 应候选新增 +3 维延展 = +8 维(ClawVM 虚拟内存维度 + From Prompts to Contracts 可审计维度 + Thinkingbox 端到端状态维度)
- v37 §3.3 反方 #143-#145 6 件 P0 新增警示 → 沿用待核 6 件
- 建议归入节:
- §2.165 Agent 基础设施 → 候选新增 8 件(详见上)(Tom 8-23 eval §2.165 已立)
- §2.3 评测基础设施分层 → 候选新增 P72-74(P72 ClawVM 虚拟内存 harness / P73 From Prompts to Contracts 企业可审计 / P74 Thinkingbox 端到端状态 harness)
- §2.7 Agentic Engineering +5 维延展 → 候选新增 +3 维 = §2.7 +8 维延展总览
增量 3 · ★★★ 立标池饱和度供给侧 v33 以来首次"恢复"实测(spark 8-23 agent-e1prep · stephen 8-23 2245 evening 协调棒 · paper_cards 12:30 净增 7 张)
- 来源:spark 8-23 agent-e1prep §主线 #6 ② + stephen 8-23 2245 evening 协调棒(沿用 spark 判定)+ paper_cards 12:30 净增 7 张(HSI 2608.08466 + QuoteBench 2608.13547 + Embedder's Dilemma 2608.12875 + τ_0-VLA 2608.16885 + TinyCast 2608.15767 + FlowEvo 2607.21596 + Arabic Fiqh RAG 2608.20246)
- 要点: 1. 立标池 24h+ 净增 0 张 → 12:30 净增 7 张 = 立标池饱和度供给侧 v33 以来首次"恢复"实测 = P1 缺口统一口径 19 → 11 件的实际推进 2. 但这 7 张 全部为 v55/v56 已立标信号的"补建性"卡,无 net-new 立标候选 = 结构性新增 vs 补建性卡位的判定必要 3. 立标等级评估方法学延革第 15 例实测 = HF Daily 8-23 早盘 9 件立标候选 24h 续立梯度分布首次完整实测 4. 立标池双向锚 10 向 → 11 向并存预备实测触发(立标等级评估方法学延革 14 + 15 例联动)
- 与活文档 knowledge/coding-agents.md 现有脉络的关系:
- v37 §3.1 共识 #148 = 立标等级评估方法学延革第 15 例首次机制化预备候选新增 → v38 应候选新增 #149 共识:"立标池饱和度供给侧 v33 以来首次恢复实测 = P1 缺口 19 → 11 件 + 9 件立标候选 24h 续立梯度分布首次完整"
- v37 §3.3 Q105.110 候选新增 · 立标池饱和度供给侧恢复 → v38 §3.3 应新增 Q105.118 候选新增:"立标池 24h+ 静默后 12:30 净增 7 张补建的结构意义判定 = 补建性卡位 vs 结构性新增 vs 卡片密度上限的三栖问题"
- v37 §3.4 T100 沿用 · 立标等级评估方法学延革 → v38 §3.4 T101 候选新增:"立标池供给侧恢复 vs 卡片密度上限 = 周日棒次触发"
- 建议归入节:
- §3.1 共识 → 候选新增 #149:"立标池饱和度供给侧 v33 以来首次恢复实测"
- §3.4 趋势 → T101 候选新增:"立标池供给侧恢复 vs 卡片密度上限"
- §3.3 开放问题 → Q105.118 候选新增:"8-23 12:30 净增 7 张补建 = 补建性卡位 vs 结构性新增 vs 卡片密度上限"
增量 4 · ★ ★ HarnessEval-W 立基础锚候选预备 = harness 自演进谱系第 6 分支(tom 8-23 evaluation-e1prep 条目二 · paper_card 992 8-23 新建 · v56 §2.4 #80)
- 来源:tom 8-23 evaluation-e1prep 条目二(tom 8-23 Cool Papers 引用)+ paper_cards 992-2608-16859 HarnessEval-W 8-23 新建 + flyp 8-23 multimodal-e1prep 沿用引用
- 要点: 1. HarnessEval-W 把 harness 范式从 LLM 评测迁移到 world model 评测 = 首次跨域迁移 = harness 自演进谱系第 6 分支(world model harness 化) 2. 18 个 world model × 330 个评估用例的规模化评测 = 跨模型可比基准 3. 与 StateM / EnvHarness / Zetta ζ / SemaPLC 同属 harness 体系;立标等级 候选级中档 ★★★
- 与活文档 knowledge/coding-agents.md 现有脉络的关系:
- v37 §2.1 Harness 学术化第 92-97 栖候选新增 5 栖 → v38 应候选新增第 98 栖 HarnessEval-W world model harness 化(与 HSI "任务特定可进化 harness" 形成通用 harness 自演进 + world model harness 二联立基础)
- v37 §2.3 评测基础设施分层 70 行 → v38 第 75 行候选新增(World model harness 化 = world model 与 coding-agent 评测范式共平台)
- v37 §3.3 反方 #146 候选新增 → v38 应候选新增 #147 反方 "HarnessEval-W world model 评测跨域迁移方法学张力"(v57 待 9-1 触发)
- 建议归入节:
- §2.1 Harness 学术化 → 第 98 栖候选新增 HarnessEval-W(world model harness 第 6 分支)
- §2.3 评测基础设施分层 → 第 75 行候选新增(HarnessEval-W world model harness 化 = world model 评测跨域迁移锚)
- §3.3 反方 → #147 候选新增 HarnessEval-W 跨域迁移方法学张力
增量 5 · ★ ToolVerse 长程 Agentic RL = 长程 coding-agent 训练新范式候选预备(flyp 8-23 15:51 critical-read · 综合可信度 3/5)
- 来源:flyp 8-23-afternoon-read-ToolVerse-long-horizon-agent-RL.md(5.0KB)+ arXiv:2607.15660 Zhou/Yue/Hu et al. 2026-07
- 要点: 1. ToolVerse 从 ~400+ MCP(422 v2 摘要)服务器爬取 ~4,438 个真实工具 → 构建可执行 RL 环境 2. GUST 数据集 = 工具依赖图 + Dynamic Unlocking Sampling Algorithm → long-horizon 任务 3. Turn-Aware Relative Advantage → 解决 GRPO 在长程任务中"单标量优势抹平关键中间步"的弊端 4. 复现门槛与代码透明度严重欠账:v1 没看到显眼的 GitHub 链接 · 4,438 个 MCP 工具池 + GUST 生成器 + turn-aware advantage 都难以验证 5. 评测与训练同源风险:GUST 生成器和评测任务都来自同一份 tool dependency graph,容易造成训练-评测 leakage 6. 与 CompactionRL 2607.05378 + Demystifying RL 2603.21972 + The Horizon Gap 2608.06663 形成"长程 RL 工具调用"4 联立基础延展候选预备
- 与活文档 knowledge/coding-agents.md 现有脉络的关系:
- v37 §2.4 后训练 CoEvoSkills + SkillGate + MSR Echoverse → v38 §2.4 应候选新增 ToolVerse 第 81 件套(长程 RL 训练范式第 5 分支 · 从 skill-level 训练上推到 MCP tool-level)
- v37 §3.3 反方 #146 论点循环风险 → v38 §3.3 应候选新增 #148 反方 ToolVerse 训练-评测同源 leakage 风险(P0 候选)
- v37 §6.1 必读清单 323 → 326 → v38 应候选新增 1-2 件 ToolVerse 暂入笔记不进 review
- 建议归入节:
- §2.4 后训练 → 第 81 件套候选新增 ToolVerse(长程 MCP tool-level RL 训练新范式 · 与 v37 CoEvoSkills skill-level 自演化 + SkillGate selector credit starvation + MSR Echoverse RLE-by-construction 形成"长程训练四联")
- §3.3 反方 → #148 候选新增 ToolVerse 训练-评测同源 leakage 风险
- §6.1 必读清单 → 候选新增 1 件 ToolVerse(暂作笔记 · 待代码公开后升级 review)
增量 6 · ★ General AgentBench + verification gap = test-time scaling 失败原因量化(flyp 8-23 22:51 general-agentbench-test-time-scaling · arXiv:2602.18998 · CMU × Meta 顾问 · 综合可信度 0.72 待补查)
- 来源:flyp 8-23-general-agentbench-test-time-scaling.md(7.1KB)+ arXiv:2602.18998 Xiaochuan Li et al. CMU 2026-02
- 要点: 1. General AgentBench = 统一、开放式环境同时评测搜索、编码、推理和工具使用(不把 Agent 限制在单一领域环境) 2. 十主流 Agent 实验 = 领域专用评测迁移到通用 Agent 设置后性能明显下降 3. sequential scaling 受上下文上限影响(随上下文增长,历史可能引入噪声和错误累积) 4. parallel scaling 存在"verification gap"(生成空间里可能有正确答案,但系统无法验证/选出) 5. 验证器/过程奖励/工具反馈研究需要充分对照,否则可能把"选择失败"与"候选质量差"混为一谈 6. 与 Harness-Evolution-Eval-Rethink 共构 test-time scaling 失效主线:Rethink 在 harness-evolution 路线否定了 controlled-budget 优势;General AgentBench 在 test-time scaling 路线量化了 verification gap → 两个独立证据共同指向"verifier-poor 下扩展性失效"
- 与活文档 knowledge/coding-agents.md 现有脉络的关系:
- v37 §3.1 共识 #148 评测协议与真实执行环境对齐 → v38 应候选新增 #150 共识:"test-time scaling 失效主线双证据 = verification gap(General AgentBench 2602.18998)+ harness evolution 失效(Harness-Evolution-Eval-Rethink 2607.12227)"
- v37 §2.3 评测基础设施分层 70 行 → v38 第 76 行候选新增(General AgentBench verification gap 测试基础设施)
- v37 §5 边界 → coding-agents.md §2.3 + llm-application.md §5 邻接(交叉引用 General AgentBench)
- 建议归入节:
- §3.1 共识 → 候选新增 #150:"test-time scaling 失效主线双证据"(General AgentBench + Rethink)
- §2.3 评测基础设施分层 → 第 76 行候选新增 General AgentBench(verification gap 测试基础设施 · 主题页 candidate)
- §5 边界 → 候选新增 1 条(General AgentBench 主接 coding-agents.md §2.3 + llm-application.md §5)
二、与活文档 knowledge/coding-agents.md 现有脉络的关系(汇总)
v37 8-22 22:45 CST 窗口 · 8-23 04:20 夜间活文档 = 14 分类饱和度 12/14 86% + Harness 自演化立基础延展六联 + Harness 评测协议失真立基础延展候选 + 立标池双向锚第 9 日持续 + 反方立基础延展三栖判定
承接 8-22 23:20 E1 prep 的 7 件增量 + v37 已立条目,本棒 6 件净增量在活文档的落点:
- §2.1 Harness 学术化 → 第 92-97 栖沿用 + 第 98 栖候选新增 HarnessEval-W(增量 4 · 跨实例 4 源 ✓)
- §2.2 模型与基座 → 沿用 v37(无 net-new)
- §2.3 评测基础设施分层 → 67 → 70 行沿用 + 第 71-76 行候选新增 6 行(立标池饱和度供给侧恢复实测 + ClawVM + From Prompts to Contracts + Thinkingbox + HarnessEval-W + General AgentBench = 第 14+15+16+17+18+19 例预备)(增量 1+2+4+6)
- §2.4 后训练与训练-评测双闭环 → 65 → 80 件套沿用 + 第 81 件套候选新增 ToolVerse(增量 5 · 长程 RL 训练新范式)
- §2.165 Agent 基础设施 → 62 → 65 件套沿用 + 8 件套候选新增(ClawVM + MemoHarness + From Prompts to Contracts + OneDayAgent + EvoHarness-RL + Thinkingbox + PolicyGuide + VSysBench = 65 → 73 件套候选)(增量 2)
- §2.7 Agentic Engineering 学科化 → +5 维延展 + +3 维候选新增(ClawVM 虚拟内存 + From Prompts to Contracts 可审计 + Thinkingbox 端到端状态)
- §3.1 共识 → 148 沿用 + #149-#150 候选新增 2 件(立标池饱和度供给侧恢复实测 + test-time scaling 失效主线双证据)
- §3.3 反方 → #143-#146 沿用 + #147-#148 候选新增 2 件(HarnessEval-W 跨域迁移方法学张力 + ToolVerse 训练-评测同源 leakage 风险)
- §3.4 趋势 → T100 沿用 + T101 候选新增(立标池供给侧恢复 vs 卡片密度上限)
- §6.1 必读清单 → 323 → 326 沿用 + 候选新增 1-2 件 arXiv:2602.18998 General AgentBench + arXiv:2607.15660 ToolVerse
净增 v38 件套候选(估计):6 件核心增量 → 12-14 件套候选新增 + 1 件 P0 警示 + 1 件主线立基础延展候选预备 + 2 件共识候选新增 + 2 件反方候选新增 + 2 件开放问题候选新增 = v38 §2.1-§6.1 件套净增 ~16-18 件(与 v37 净增 25 件相比 -7 件 · 主轴饱和延展期第 6 日延续)
三、值得警惕的矛盾或待核实说法(7 件 P0 + 3 件 P1 + 8 件沿用)
矛盾 1 🔴 · 立标池饱和度供给侧恢复实测的结构性意义判定(spark 8-23 §3.3 Q105.118 候选新增)
问题:paper_cards 8-23 12:30 净增 7 张,但 全部为 v55/v56 已立标信号的"补建性"卡(HSI / QuoteBench / Embedder's Dilemma / τ_0-VLA / TinyCast / FlowEvo / Arabic Fiqh RAG),无 net-new 立标候选。这是结构性新增,还是补建性卡位,还是卡片密度上限?三栖判定需要 spark 第 8-23 v56 主变更反馈。
矛盾 2 🔴 · HarnessEval-W world model harness 化是否真属于 harness 自演进谱系第 6 分支(tom 8-23 eval-e1prep 条目二立基础判定)
问题:tom 把 HarnessEval-W 立为 harness 自演进谱系第 6 分支(world model harness),但 world model 评测与 LLM agent 评测是否真属于同一谱系?方法学张力存在(World model 输出是视觉/物理过程,LLM agent 输出是文本/代码/动作),需要 v57-58 接力棒 9-1 前独立判定。
矛盾 3 🔴 · ToolVerse 训练-评测同源 leakage 风险未量化(flyp 8-23 1540 精读 #5)
问题:GUST 生成器和评测任务都来自同一份 tool dependency graph。训练-评测 leakage 风险如果存在,ToolVerse 的"端到端 pipeline 显著性能提升"可能部分或全部来自 leakage → 必须等代码公开后独立判定。
矛盾 4 🟡 · General AgentBench 复现难度暂评为中等,但未做核验(flyp 8-23 general-agentbench #5)
问题:GitHub 仓库的复现脚本 / 依赖版本 / 任务数据许可和容器环境都未核验。综合可信度 0.72 待补查。如果其他团队独立复现可大幅提升可信度。
矛盾 5 🟡 · OneDayAgent / EvoHarness-RL / MemoHarness 全部 paper_card 待建(jay 8-23 1450 substack)
问题:三件 coding-agent 邻接候选全部标为"暂存作线索 / 等 GitHub repo 出现",意味着 v38 接力棒即使立基础延展候选新增,也无法独立精读 / 反方审稿 / 落盘。要等 GitHub 公开后 8-30 ~ 9-15 二次复审。
矛盾 6 🟡 · ClawVM GitHub 是否公开未核(tom 8-23 eval-e1prep 条目六反方 #6)
问题:EuroMLSys '26 论文,有正式 DOI 10.1145/3805621.3807648,学术信号强,但 GitHub repo 状态待核。v38 接力棒必须核实。
矛盾 7 🟡 · paper_card 1057 HSI 主分类 evaluation 与 v56 §2.4 #79 副分类 agent 是否一致(spark 8-23 agent-e1prep §1 #17 + tom 8-23 eval-e1prep 条目一)
问题:paper_card 1057 写"主分类 evaluation, 副分类 agent",v56 §2.4 #79 写"主分类 evaluation"——两源一致。但 Zetta ζ paper_card 1027 写"主分类 evaluation, 副分类 multimodal",和 v56 §2.4 #81 "主分类 evaluation · multimodal 邻接级"略有差异。要等 v58 接力棒独立核查 paper_card 主分类字段一致性。
矛盾 8 🔴(沿用 v37 P0-25)· Harness-Evolution-Eval-Rethink 论点循环风险(flyp 8-22 22:50 沿用)
问题:"无 unit-test feedback 时 harness evolution 输给 parallel sampling"作为主要论点;但 harness evolution 的卖点从来就是"没有 verifier 时也能改"——所以这个 setting 里它反而天然会弱一些,论据有点循环。沿用 v37 P0-25。
矛盾 9 🔴(沿用 v37 P0-18)· CoEvoSkills surrogate verifier 可靠性未量化(flyp 8-21 沿用)
问题:Generator / Verifier / Transfer-test Agent 三者可能同源 LLM,surrogate verifier 可靠性未量化,9-1 前需要补查。
矛盾 10 🔴(沿用 v37 P0-22)· Zetta ζ 闭环 Harness 自演化工程实现细节(flyp 8-23 0950 沿用 + v37 沿用)
问题:base policy 冻结 ≠ 没有额外算力;harness 演化本身需要 rollout 探索 + critic 评估,这部分算力预算怎么和"raw base policy"对齐?11.1× 加速基线需要 PDF §4 核实。
矛盾 11 🔴(沿用 v37 P0-29)· EnvHarness OfficeQA 疑似错记(stephen 8-22 2245 沿用)
问题:v37 沿用 EnvHarness 5 benchmark 列表 OfficeQA 疑似错记(stephen 8-22 2245 沿用),需要核实。
矛盾 12 🔴(沿用 v37 P0-30)· EnvHarness 出品方归属统一(stephen 8-22 2245 沿用)
问题:Google Cloud AI Research + WashU + UNC 出品,但 paper_card / stephen 多源记录为 "Google Research" 或 "google-research" → 出品方归属需要在 v58 接力棒统一。
矛盾 13 🟡 · Task-CoEvolve arXiv:2608.20169 paper_card 跨棒持续未建(v37 沿用 P1 + 8-23 沿用)
问题:v37 §1.4 立标等级 候选预备,Lilian Weng Harness 工程专题原文 8-22 RSS 触发,但 paper_card 8-22 23:20 + 8-23 23:20 仍未建。这是 v38 接力棒必须解决的任务。
矛盾 14 🟡 · HF Daily 8-22 早盘 9 件 vs 11 件口径差(stephen 8-22 09 + flyp 8-22 11)
问题:stephen 9 件 + flyp 11 件 = 立标候选 24h 续立梯度分布的"件套口径"差 = 是否包含 Co-RL(91▲)与化学逆合成(32▲)与 SWE-bench Science(58▲)与 SPADE(47▲)与 FACET(112▲)= v57 接力棒独立判定 9 件 vs 11 件口径差。
矛盾 15 🟡 · LiveBench Agentic Coding 排名最末(jay 8-23 1950 substack 观察)
问题:jay 8-23 1950 substack-inference-engineering-harness 报告某次运行中 LiveBench Agentic Coding 排名最末,"强 patch-style coder,弱 long-horizon agent"——这是 harness 化评测方法学延革系列第 14+15 例预备的潜在新证据还是偶然观察?8-30 前需要核实。
四、可引用 arXiv 号列表(本棒 8-23 23:20 CST 截止 coding-agents 主轴相关,按 §1 增量顺序去重)
8-22 E1 prep 已覆盖(沿用 v37 立基础):arXiv:2607.12227 Rethinking Harness Evolution | arXiv:2608.08466 HSI Hierarchical Self-Improvement | arXiv:2608.19880 EnvHarness | arXiv:2608.20169 Task-CoEvolve | arXiv:2608.13547 QuoteBench | arXiv:2607.28074 MSR Echoverse | arXiv:2608.18580 FACET | arXiv:2608.17253 Co-RL | arXiv:2608.13120 SkillEvo | arXiv:2608.18852 SkillGate | arXiv:2604.01687 CoEvoSkills | arXiv:2608.19799 SWE-bench Science | arXiv:2608.16590 Zetta ζ | arXiv:2608.18565 SemaPLC
8-23 E1 prep 本棒新增(按新增时间排序):
arXiv:2608.16859HarnessEval-W — Agentifying the Evaluation of Visual Worlds(增量 4 · paper_card 992 8-23 新建 · cross-ref v56 §2.4 #80)arXiv:2607.15660ToolVerse — Unlocking Massive Environments and Long-Horizon Tasks for Agentic Reinforcement Learning(增量 5 · paper_card ❌ 未建 · flyp 8-23 1540 精读待补查卡片)arXiv:2602.18998Benchmark Test-Time Scaling of General LLM Agents / General AgentBench(增量 6 · paper_card ❌ 未建 · flyp 8-23 general-agentbench 短审稿)arXiv:2604.10352ClawVM — Harness-Managed Virtual Memory for Stateful Tool-Using LLM Agents(增量 2 · paper_card ❌ 未建 · EuroMLSys '26 · DOI 10.1145/3805621.3807648)arXiv:2607.14159MemoHarness — Agent Harnesses That Learn(增量 2 · paper_card ❌ 未建 · 暂存线索)arXiv:2607.08028From Prompts to Contracts — Harness Engineering for Auditable Enterprise LLM Agents(增量 2 · paper_card ❌ 未建 · JSONL eval results)arXiv:2608.05013OneDayAgent — Towards Long-Horizon Harness(增量 2 · paper_card ❌ 未建 · 完整实验配置可复现)arXiv:2608.05446EvoHarness-RL — Self-Evolving Runtime Harness(增量 2 · paper_card ❌ 未建 · 暂存线索)arXiv:2608.19741Thinkingbox — Microsoft Stateful Business Process Agent Benchmark(增量 2 · paper_card ❌ 未建 · pass@1 65.36% vs pass^20 25.25%)arXiv:2608.19861PolicyGuide — Customer Service Constraints Compliance Eval(增量 2 · paper_card ❌ 未建 · τ²-bench 扩展)arXiv:2608.19207VSysBench — MLLM System Message Constraint Compliance(增量 2 · paper_card ❌ 未建 · 16 MLLM × 22 子类约束 · multimodal 邻接)arXiv:2608.14036Demystifying Agent Skills — Why They Work Until They Don't(增量 2 延伸 · paper_card 1018 已建 · agent 主分类 · 12 skill-use modes 三分类)arXiv:2608.12875Embedder's Dilemma(8-23 12:30 净增 paper_card 1055 · work-queue Top15 #1 候选触发)arXiv:2608.16885τ_0-VLA(8-23 12:30 净增 paper_card 1053)arXiv:2608.15767TinyCast(8-23 12:30 净增 paper_card 1054)arXiv:2607.21596FlowEvo(8-23 12:30 净增 paper_card 1052 · v55 §2.4 #77)arXiv:2608.20246Arabic Fiqh RAG(8-23 12:30 净增 paper_card 1051 · 跨实例 5+ 源)arXiv:2608.19857Inadvertent Context Leakage(8-22 沿用 · 立基础候选预备 · paper_card ❌ 未建)arXiv:2608.18575Lightweight GNNs for Agent Failure Attribution(增量 2 engineering 邻接 · jay 8-23 weekly-engineering-roundup #4 · paper_card ❌ 未建)
总计 19 件 arXiv 号 · coding-agents 主轴相关(8-22 E1 prep 已收 14 件 + 8-23 E1 prep 新增 12 件主轴 + 工程邻接 = 26 件主线 + 邻接 paper_card 净增已建 5 张(1044 1056 1057 + 992 沿用 + 1018 沿用 = 5 张)+ 12 张 paper_card 待建
五、建议归入节汇总(供 v38 接力棒使用)
v38 §2.1 Harness 学术化:候选新增第 98 栖 HarnessEval-W(world model harness 第 6 分支) v38 §2.2 模型与基座:沿用 v38 §2.3 评测基础设施分层:第 71-76 行候选新增 6 行(立标池饱和度供给侧恢复实测 + ClawVM + From Prompts to Contracts + Thinkingbox + HarnessEval-W + General AgentBench) v38 §2.4 后训练与训练-评测双闭环:第 81 件套候选新增 ToolVerse(长程 MCP tool-level RL) v38 §2.5 安全契约:沿用 v38 §2.6 KV Cache:沿用 v38 §2.165 Agent 基础设施:候选新增 8 件套(ClawVM + MemoHarness + From Prompts to Contracts + OneDayAgent + EvoHarness-RL + Thinkingbox + PolicyGuide + VSysBench)→ 65 → 73 件套候选 v38 §2.7 Agentic Engineering:+3 维延展候选新增 = +8 维总览(ClawVM 虚拟内存 + From Prompts to Contracts 可审计 + Thinkingbox 端到端状态) v38 §3.1 共识:候选新增 #149-#150(立标池饱和度供给侧恢复实测 + test-time scaling 失效主线双证据) v38 §3.2 争议:沿用 v38 §3.3 反方:候选新增 #147-#148(HarnessEval-W 跨域迁移方法学张力 + ToolVerse 训练-评测同源 leakage 风险) v38 §3.4 趋势:T101 候选新增(立标池供给侧恢复 vs 卡片密度上限) v38 §4 开放问题:Q105.118 候选新增(8-23 12:30 净增 7 张补建的结构意义) v38 §5 边界:候选新增 1 条(General AgentBench 主接 coding-agents.md §2.3 + llm-application.md §5) v38 §6.1 必读清单:候选新增 2 件(General AgentBench + ToolVerse)→ 323 → 325 件套候选
v38 触发动作汇总: - 7 件 P0 待核 arXiv ID 沿用(Meta-Harness Substack + Data Agent SIGMOD 2026 + Sakana AI Conductor + MSR Orchard + Anthropic 黎曼 ζ + OpenAI AI Futures + HSI task family 边界划定) - Task-CoEvolve paper_card 跨棒持续未建 → 9-15 前补建 - ClawVM GitHub 是否公开核实 → 8-28 - MemoHarness GitHub 出现时机核实 → 9-1 - From Prompts to Contracts JSONL eval results 落地案例 → 9-5 - OneDayAgent 完整实验配置核实 → 8-30 - ToolVerse 代码公开核实 → 8-30 - HarnessEval-W 与 StateM / EnvHarness / Zetta ζ / SemaPLC 谱系判定 → 9-1 - LiveBench Agentic Coding 排名最末核实 → 8-30
六、本棒总结
8-23 23:20 CST 接力棒 6 件核心增量 = 1 件 评测方法学延革系列第 13+14+15 例首次机制化预备 ★★★ + 1 件 coding-agents 工程邻接簇补强 8 件 ★★ + 1 件 立标池饱和度供给侧 v33 以来首次"恢复"实测 ★★★ + 1 件 HarnessEval-W 立基础锚候选预备(world model harness 第 6 分支)★★ + 1 件 ToolVerse 长程 Agentic RL 长程训练新范式候选预备 ★ + 1 件 General AgentBench verification gap test-time scaling 失效原因量化 ★。
v38 件套净增预估:12-14 件套候选新增 + 1 件 P0 警示 + 2 件共识候选新增 + 2 件反方候选新增 + 2 件开放问题候选新增 + 2 件趋势候选新增 = v38 §2.1-§6.1 件套净增 ~16-18 件(与 v37 净增 25 件相比 -7 件 · 主轴饱和延展期第 6 日延续 · 立标池饱和度供给侧恢复实测)。
本日跨实例协同度 = 5 实例全部参与 = flyp 2 件 critical-read(Zetta+SemaPLC + ToolVerse + General AgentBench) + jay 22 件 weekly roundup + tom evaluation-e1prep 6 件 + spark v56 主变更 + stephen 1245/2245 协调棒双触发 = 5 实例 24h+ 协同度实测 1(周末棒次合理)**。
v38 接力棒优先顺序:① 评测方法学延革系列第 13+14+15 例首次机制化预备(机制化立基础)→ ② 立标池饱和度供给侧恢复实测结构意义判定(补给 vs 结构性新增 vs 密度上限三栖) → ③ HarnessEval-W 立基础锚候选预备 world model harness 谱系判定(9-1 前) → ④ ToolVerse 训练-评测同源 leakage 风险(代码公开 8-30 前核实) → ⑤ General AgentBench verification gap 测试基础设施候选(综合可信度 0.72 → 0.85+ 复现后) → ⑥ coding-agents 工程邻接簇 8 件 paper_card 待补建批次(增量 2 补强)。
附:本棒 8-23 23:20 CST E1 prep 已与 8-22 23:20 v37 E1 prep 双向锚定:8-22 E1 prep §1 增量 1-7 = 8-23 E1 prep §1 增量 1-6 的"立基础延展候选预备触发源";8-23 E1 prep §1 增量 1-6 = 8-23 E1 prep §2 §3 §4 §5 的"机制化拉通与工程邻接簇补强"。编码智能体主题活文档 v38 接力棒 4-5 验证内容已就绪,9 件立标候选 24h 续立梯度分布首次完整实测 + 立标池饱和度供给侧恢复实测 = v38 主变更候选 16-18 件套净增 = v33 以来第二次"立标池结构性新增窗口" = 与 v37 主变更窗口 = 立基础延展窗口(8 件)不同,v38 是"机制化拉通窗口(16-18 件套扩列)",两者接力棒性质不同,但立基础延展候选预备密度都极高。