coding-agents · E1 预消化简报(2026-08-22)

承接 v36 第三十六棒(8-22 04:20 夜间活文档 · 8-21 22:30 CST 窗口)·本棒为 8-22 23:20 CST 接力棒准备。编码智能体(coding agents / agent harness / SWE-bench / Terminal-Bench / software engineering automation / 安全 + IDE 集成)主题 · 8-22 白天 22h 内 5 实例 30+ 文件 ~750 KB 综合预消化。

全局结论:stephen 8-22 22:45 evening 协调棒判定 coding-agents 主轴持续 0 件主线净增(主轴饱和延展期第 5 日延续);但 flyp 8-22 22:50 Harness-Evolution-Eval-Rethink critical-read + tom 8-22 evaluation-e1prep HSI 立基础锚候选预备 + spark 8-22 agent-e1prep "Harness 自演化立基础延展五联" + jay 8-22 1001-rss-lilian-weng 全文 + stephen 8-22 22:45 evening 协调棒触发事件,共同确认 3 件 coding-agents 邻接级 net-new + 2 件延展候选升级(评测协议失真立基础延展候选新增 + HSI 立基础锚候选预备 + Task-CoEvolve 候选预备)。建议今晚 v37 接力棒在承接 v36 判定的同时,新增"harness 评测协议失真"作为 coding-agents §2.3 评测基础设施分层的立基础延展候选(arXiv:2607.12227 Rethinking Harness Evolution 升级裁定:从 v31 §1.2 Reliability 三十维 + coding-agents §2.1 沿用引用升级到 §2.3 评测基础设施分层候选新增),新增 HSI(Task-Specific Evolvable Agent Harness)作为 harness 自演进谱系第 5 分支候选(与 Zetta ζ "harness 内组件自演化"形成"harness 自身重写 vs harness 内组件自演化"双轨),新增 Task-CoEvolve 作为 harness 自演化的工程级实现候选(Lilian Weng Harness 工程专题原文 8-22 RSS 触发)。


〇、检查范围与依据(诚实度声明)

今日(8-22 23:20 CST 截止)检查过的来源:

flyp inbox 8-22 11 份: - 2026-08-22-1000-rss-cameron-wolfe.md(901B · 沿用 v36)+ 2026-08-22-1002-rss-interconnects.md(1.1KB · 沿用 v36)+ 2026-08-22-1004-rss-yt-ai-explained.md(636B · 沿用 v36)+ 2026-08-22-1004-rss-yt-two-minute-papers.md(616B · 沿用 v36) - 2026-08-22-EnvHarness-and-4DAnyone-critical-read.md(19.9KB · EnvHarness 主分类 evaluation 副 multimodal 判定 · 评测方法学延革第 12 例反方立基础候选预备 + 4DAnyone 4D 重建分支首件 + 5 条反方审稿) - 2026-08-22-1030-sat-weekly-deep-read-notes.md(29.6KB · 3 件 high-value 候选精读笔记 = StateM arXiv:2608.15089 + SCA arXiv:2506.01716 NeurIPS 2025 + Video-LevelGauge arXiv:2508.19650 ICLR 2026) - 2026-08-22-1030-sat-weekly-deep-read-reviews.md(25.8KB · 3 件反方审稿) - 2026-08-22-sat-weekly-deep-read-summary.md(16.3KB · 立标等级维持判定) - 2026-08-22-1550-SemComp-Bench-semantic-task-completion-video-gen-critical-read.md(19.3KB · multimodal 邻接级) - 2026-08-22-multimodal-e1prep.md(53.7KB · 沿用 EnvHarness 评测方法学延革第 12 例预备 · 5 件 multimodal 主分类 / 邻接级) - 2026-08-22-2250-Harness-Evolution-Eval-Rethink-critical-read.md(7.2KB · ★★★ 立基础延展候选新增 · arXiv:2607.12227 升级裁定 = coding-agents §2.3 评测基础设施分层候选新增) - 2026-08-22-risk-e1prep.md(64.1KB · multimodal / risk 主轴 · R50 沿用期延续)

jay inbox 8-22 18 份(已抽样 1001-rss-lilian-weng + 1003-rss-msr-blog + T2105-five-category-briefing + engineering-e1prep): - 2026-08-22-1001-rss-lilian-weng.md(1.4KB · ★★ Harness 工程专题原文 · Task-CoEvolve arXiv:2608.20169 = Lilian Weng 引用论文) + 2026-08-22-1001-rss-cool-papers.md(1.5KB · 包含 Task-CoEvolve 摘要)+ 2026-08-22-1001-rss-cool-papers-ir.md(1.5KB · 包含 BrowseComp-Plus 错配·P0) - 2026-08-22-1001-rss-simon-willison.md(1.5KB · 沿用 v36) - 2026-08-22-1001-rss-nathan-benaich.md(1.6KB · 沿用 v36) - 2026-08-22-1003-rss-import-ai.md(1.2KB · Import AI 469 Jack Clark RSI 模拟器) - 2026-08-22-1003-rss-msr-blog.md(1.9KB · MSR Orchard + MSR Echoverse 沿用 v36) - 2026-08-22-1004-rss-yt-karpathy.md(561B · 沿用)+ 2026-08-22-1005-rss-yt-fireship.md(670B · 沿用) - 2026-08-22-1140-news-x-tech-radar.md(3.0KB · OpenClaw Mac Mini +50% + Sakana Conductor 7B RL 调度 + ExtractBench 95.6%) - 2026-08-22-engineering-e1prep.md(20.6KB · 主轴静默 + Foundry AgentRx 故障恢复体系 + Inadvertent Context Leakage 沿用 + Microsoft Foundry + kv-cache-analyzer CLI) - 2026-08-22-llm-inference-engineering-screening.md(8.7KB · 沿用 noon 棒 spark 备料) - 2026-08-22-database-e1prep.md(20.5KB · database 主棒连续第 9 轮零新增) - 2026-08-22-rag-agent-mcp-multimodal-survey.md(13.0KB · SoK Agentic RAG 89% vs 34% + Agentic RAG vs Enhanced RAG ACL 2026 + MCP Security Crisis) - 2026-08-22T1050-jay-engineering-filter.md(13.1KB · 沿用) - 2026-08-22T1220-jay-csdn-rag-tensorrt-sourcecode-highvalue.md(16.2KB · QAnything + Spring AI 1.1.x + RagFlow 工业级 CSDN) - 2026-08-22T1335-jay-ai-engineering-trending-mid-aug.md(12.9KB · AI 工程趋势 8 月中) - 2026-08-22T1450-jay-engineering-filter-pm.md(16.6KB · PM engineering-filter) - 2026-08-22T1735-jay-ai-engineering-trending-aug22.md(9.5KB · 晚棒 AI 工程趋势) - 2026-08-22T2105-jay-five-category-briefing.md(12.4KB · Lilian Weng Harness 工程全文笔记 = BE-1 + MSR Orchard/Echoverse = BE-2/3 + Task-CoEvolve = BE-5 联动 + Import AI 469 = BE-5 + ConceptGuard 2608.20338 = BE-4) - 2026-08-22T2300-jay-five-category-supplement.md(8.4KB)

tom inbox 8-22 9 份: - 2026-08-22-0900-hf-daily-2026-08-22.md(1.8KB · 15 件 HF Daily 早盘 · coding-agents 邻接级 5 件 net-new = EnvHarness 235▲ #1 + Zetta ζ 140▲ + SemaPLC 114▲ + Co-RL 90▲ + SkillEvo 27▲ + 5 件 multimodal / env-agent 邻接) - 2026-08-22T0840-agent-rag-longcontext-radar.md(4.2KB · ★ Embedder's Dilemma 2608.12875 + Inadvertent Context Leakage 2608.19857 + HSI 2608.08466 沿用 v36 + QuoteBench 2608.13547 + τ_0-VLA 2608.16885 + TinyCast 2608.15767 + FlowEvo 2607.21596 + Arabic Fiqh RAG 2608.20246 + AI Agents Stack 2026) - 2026-08-22T2040-agent-rag-longcontext-radar.md(3.1KB · 晚棒 3 件去重) - 2026-08-22-evaluation-e1prep.md(17.4KB · ★★★ HSI arXiv:2608.08466 = paper_card 1057 8-22 14:13 新建 = eval 专项 net-new ★★★ 立基础锚候选预备 + EnvHarness arXiv:2608.19880 = HF Daily 235▲ #1 + FACET arXiv:2608.18580 + MemTrapBench arXiv:2608.20202 + QuoteBench arXiv:2608.13547) - 2026-08-22-inference-e1prep.md(19.8KB · 沿用 noon 棒 spark 备料) - 2026-08-22-rag-e1prep.md(18.4KB · Inadvertent Context Leakage + IAR 三阶段后训练 + Embedder's Dilemma + Arabic Fiqh RAG + QuoteBench) - 2026-08-22-1004-rss-yt-lex-fridman.md(839B · 沿用)+ 2026-08-22-1004-rss-yt-yannic-kilcher.md(629B · 沿用)

spark inbox 8-22 3 份: - 2026-08-22-agent-e1prep.md(65KB · ★★★ coding-agents 主轴饱和 + 7 件 net-new = Task-CoEvolve arXiv:2608.20169 + 计算机使用轨迹 arXiv:2608.20319 + ConceptGuard arXiv:2608.20338 + BrowseComp-Plus 错配 [🔴 P0]+ SoK Agentic RAG arXiv:2603.07379 [P1 编号缺补]+ Agentic RAG vs Enhanced RAG ACL 2026 + Import AI 469 Jack Clark RSI 模拟器 + Lilian Weng 全文笔记 + 3 件 v55 沿用补强 + 2 件 v55 沿用 + 2 件需人工确认争议) · 关键判定:§3.1 共识 #201 "Harness 自演化立基础延展五联" = Meta-Harness + Zetta ζ(已立)+ HSI + Task-CoEvolve + Lilian Weng 8-22 Harness 工程专题原文 - 2026-08-22-llm-infra-e1prep.md(23KB · §IX 46th 落定) - 2026-08-22-1001-rss-gradient-flow.md(1.5KB · 沿用)+ 2026-08-22-1002-rss-chip-huyen.md(1.4KB · 沿用)+ 2026-08-22-1005-rss-yt-3blue1brown.md(542B · 沿用)

stephen inbox 8-22 14 份: - 2026-08-22-0910-news-x-vip-radar.md(2.8KB · Gemini 3.7 Flash + Qwen3.8-27B + Qwen3.8-2.4T-A95B + OpenAI Astra) - 2026-08-22-1003-news-anthropic-news.md(1.7KB · 沿用)+ 2026-08-22-1003-news-deepmind-news.md(1.2KB · 沿用)+ 2026-08-22-1003-news-openai-news.md(1.3KB · 沿用)+ 2026-08-22-1004-news-bens-bites.md(668B · 沿用)+ 2026-08-22-1004-news-google-ai.md(1.4KB · 沿用)+ 2026-08-22-1004-news-hf-blog.md(670B · 沿用)+ 2026-08-22-1004-news-tldr-ai.md(698B · 沿用)+ 2026-08-22-1005-news-yt-anthropic.md(569B · 沿用)+ 2026-08-22-1005-news-yt-deepmind.md(636B · 沿用)+ 2026-08-22-1005-news-yt-openai.md(663B · 沿用) - 2026-08-22-ai-industry-e1prep.md(53.9KB · v53 落定 = coding-agents 邻接级沿用 + EnvHarness 主分类 evaluation vs multimodal 争议 + 30 条 arXiv 清单 + 4 件 P0) · 关键判定:§3.4 趋势 T160 harness-of-harness 元层设计自动化 = Zetta ζ + HSI 双轨 - 2026-08-22-llm-application-e1prep.md(60.6KB · v54 落定 = 7 条主线 + 7 条邻接级 + 11 件 v60 沿用项 + 6 件 P0 警示持续 open + 1 件 P0 RAG 评测方法学 12h SLA 同步升级) - 2026-08-22-2245-stephen-coordination-check-evening.md(35.8KB · ★ v37 接力棒上下文 · 14 分类饱和度判定 + BrowseComp-Plus 编号错 P0 + SoK Agentic RAG 编号缺 P1 + P1 paper_card 缺口数 13 vs 15 vs 19 vs 23 口径不一 + EnvHarness 5 benchmark 列表 OfficeQA 疑似错记 P0 + 11 个主棒全部到位)

近 3 天(8-20 / 8-21 / 8-22)paper_card 库新增 coding-agents 相关条目抽查:paper_cards 1056(QuoteBench · 8-22 · tom evaluation-e1prep 新建 · agent 主分类 eval 邻接)+ 1057(HSI arXiv:2608.08466 · 8-22 14:13 新建 · 主分类 evaluation 副 agent · ★★★ 立基础锚候选预备) + 沿用 1032(SkillGate · 8-20)/ 1044(SWE-bench Science · 8-22)+ 沿用 1027(Zetta ζ · 8-21)/ 434(Rethinking Harness Evolution · 7-20)。paper_card 库共 1058 张(8-22 22:00 沿用 8-22 14:13 的 1057 + 8-22 22:50 之后无新增);coding-agents 主轴相关 8-22 净增 2 件(HSI 立基础锚候选 + QuoteBench 邻接级)。

v37 接力棒预消化上下文:stephen 8-22 22:45 evening 协调棒核心动作 = v47 agent 棒 BrowseComp-Plus 编号错 P0 修复 + v47 agent 棒 SoK Agentic RAG arXiv:2603.07379 P1 补查 + P1 paper_card 缺口数 13/15/19/23 口径统一(stephen-on-spark 评审 7 分 + jay-on-stephen 评审 7.5 分 + spark-on-Tom 7 分 + tom-on-flyP 6/10 + flyP-on-Jay 7 分 · 互评闭环率 5/5 = 100%)。


一、今日 coding-agents 主轴最重要的增量(3 件 net-new 邻接级 + 2 件延展候选升级 + 1 件待判定争议)

增量 1 · Harness 评测协议失真立基础延展候选 ★★★(arXiv:2607.12227 Rethinking Harness Evolution,flyp 8-22 22:50 critical-read,paper_card 434 7-20 已建)

  • 来源:/shared/research-kb/inbox/flyp/2026-08-22-2250-Harness-Evolution-Eval-Rethink-critical-read.md(7.2KB · flyp 8-22 22:50 重读精读)+ /shared/research-kb/organized/paper_cards/434-2607.12227.md(paper_card 434 7-20 已建 · 主分类 evaluation 副 agent · v31 §1.2 Reliability 三十维沿用 · 7-21 coding-agents §2.1 Harness 自演化立基础沿用引用)+ inbox/stephen/2026-07-18-2245-stephen-coordination-check-evening.md §C21-C28 历史沿用 + inbox/spark/2026-07-19-1000-rss-gradient-flow.md spark 主线 F 沿用 + inbox/flyp/2026-07-18-1550-Harness-Evolution-Eval-Cheating-critical-read.md 7-18 首次精读 + inbox/tom/2026-07-18T1440-agent-rag-longcontext-radar.md 候选首次登记。arXiv:2607.12227 已核实(7-14 v1 + Yike Wang / Huaisheng Zhu / Zhengyu Hu / Yige Yuan / Zhengyu Chen / Shakti Senthil / Hannaneh Hajishirzi / Yulia Tsvetkov / Pradeep Dasigi / Teng Xiao* · Allen Institute for AI / UW / Independent · 代码 github.com/rethinking-harness-evolution 公开)。
  • 核心方案:Rethinking the Evaluation of Harness Evolution for Agents(7-14 v1)正面回答两个问题:① 自动 harness evolution 的「增益」到底是源自 harness 设计变好,还是只是「花在任务上的搜索预算更多」?当 search 和 final eval 共用同一个公开 benchmark 时,所谓的提升有没有可能只是对那批题目过拟合? 关键方法:公平预算协议(controlled budget protocol) —— 每个方法都收到等价的任务反馈、推理预算和轨迹/编辑面(编辑轨迹 vs 编辑 harness 本身);三类对照:Parallel sampling(多候选 + verifier 重排)/ Sequential refinement(以前轮答案为上下文逐步修正)/ Harness evolution(沿 Meta-Harness / ACE 等路线,迭代改写 prompt / skill / tool 定义等);评测集:Terminal-Bench 2.1(命令式任务,带可执行 verifier);模型:Claude Opus 4.6 / GPT-5.4 / GPT-5.4 mini;两个关键切片:有无 unit-test feedback 的 AHE 表现差异 + search tasks ≠ eval tasks 的 hold-out 泛化
  • 关键发现:没有 unit-test feedback 时,harness evolution 在三模型平均 pass@1 上 输给简单的 test-time scaling(parallel + sequential)→ 多数真实部署是闭源 verifier 不可用的,所以这条结论非常要命;同任务集内 gain 会被放大:search 和 eval 用同一份 Terminal-Bench 题目时,harness 表现出色;切到 hold-out 后优势基本消失;算力等价下,sequential refinement 是更强的 baseline;作者结论 = harness evolution 这一波工作存在评估协议问题:应当「把 search 反馈和最终评测解耦」,并以 test-time scaling 为强制对照。
  • 本次(8-22 22:50)新增判定:flyp 重读后形成的关键判断 = arXiv:2607.12227 不应再被视为 evaluation 主轴的「Reliability 三十维」,而应升级为 coding-agents 主轴 §2.3 评测基础设施分层的立基础延展候选 —— 直接对 v36 新立的 Meta-Harness(arXiv:2603.28052)+ Zetta ζ(arXiv:2608.16590)+ CoEvoSkills(arXiv:2604.01687)+ SemaPLC(arXiv:2608.18565)+ HarnessRisk(arXiv:2608.17597)+ HarnessEval-W(arXiv:2608.16859)+ SWE-bench Science(arXiv:2608.19799) 形成方法学挑战(harness 自演化 / skill 自演化 / harness 化评测方法学 / 评测可信化的所有立标候选都建立在「harness evolution = agentic test-time scaling」这一假设上,这一假设被 arXiv:2607.12227 直接质疑)。立标等级 ★★★ 中-高档,理由:方法学挑战性 + 与 v36 9 件立基础延展候选形成系统性反方对照 + paper_card 434 已建 + 跨实例多源(stephen 7-18/7-19 + spark 7-19 + flyp 7-18/7-20/7-21/8-22 + tom 7-18/7-19/7-20/8-22 沿用)。
  • 实验风险与方法学漏洞(批判本身也要带刺):① 单基准依赖(仅 Terminal-Bench 2.1,harness 自由度天然小,不像 WebArena / OSWorld 那种 rich tool/API 空间;在 harness 高维空间的问题上,这篇可能低估 evolution 收益 · 待补查:是否在 WebArena / SWE-bench / GAIA-2 上做了复制)② 回滚预算如何计入(harness evolution 需要 explorer 自己做 rollout + verifier 评分;explorer rollout 的「试错成本」是否被完整计入 inference budget)③ "Evolution underperforms" 的方向性问题(作者用「没有 unit-test feedback 时输给 parallel sampling」做主要论点;但 harness evolution 的卖点从来就是「没有 verifier 时也能改」——这个 setting 里它反而天然会弱一些,论据有点循环)④ 模型覆盖不全(GPT-5.4 / GPT-5.4 mini / Opus 4.6 都是顶级模型;中等模型下 harness evolution 收益可能不同 · 待补查:是否给出 non-frontier 模型对照)⑤ 没有 ablation evolution 粒度(没有讨论 prompt-only / skill-only / 完整 harness 哪种粒度更扛得住)⑥ 可复现性(Terminal-Bench 任务分布在 commit 之间会漂移;论文只给 v1 snapshot · 待补查:是否锁定 commit hash)。
  • 与 knowledge/coding-agents.md 现有脉络的关系:arXiv:2607.12227 在 v36 coding-agents.md 主文件中只在「附录 arXiv 编号索引」出现(line 240),从未在主文件的 §2.x 候选条目中作为立基础延展候选出现。7-21 flyp coding-agents-e1prep §2.1 Harness 自演化立基础沿用引用(详沿用)+ v31 §1.2 Reliability 第三十维 = 「Harness Evolution 评测协议反思」 沿用(但归属 llm-application 主轴)+ v25 Risk §2.6 评测信任危机五阶固化沿用(但归属 risk 主轴)。本次立标升级裁定:v37 接力棒必须独立判定 arXiv:2607.12227 应否从「evaluation 主轴 Reliability 三十维」+「coding-agents §2.1 沿用引用」升级为「coding-agents §2.3 评测基础设施分层立基础延展候选」 = 评级升级的关键标准是「它是否为 coding-agents 主轴提供 first-principle 增量」—— flyp 8-22 22:50 主张 YES,理由:① 它直接质疑 v36 立基础延展候选的方法学基础;② 它给出可操作的评估协议改写(matched feedback + inference budget + held-out tasks);③ 它与 v36 9 件候选形成系统性反方对照。
  • 建议归入节:§2.3 评测基础设施分层候选新增第 67 行 = Rethinking Harness Evolution(arXiv:2607.12227 · paper_card 434 已建 · 主分类 evaluation 副 agent · 立标等级 ★★★ 中-高档 · Harness 自演化立基础延展候选的反方立基础延展)+ §3.3 反方候选新增 #143 = Harness Evolution 评测协议失真 = coding-agents 主轴 v33 以来首次「立基础延展候选 vs 评测方法学反方」对位 + §3.4 趋势候选新增 T100 = Harness 自演化的预算可控性 + 评测协议失真 = coding-agents 主轴 8-22 立基础延展候选方法学反思
  • 关键反方:论点循环风险(作者用「没有 unit-test feedback 时输给 parallel sampling」做主要论点,但 harness evolution 的卖点从来就是「没有 verifier 时也能改」;这个 setting 里它反而天然会弱一些)→ v37 接力棒必须独立判定 arXiv:2607.12227 的反方挑战是否在 v36 9 件立基础延展候选的所有 setting 都成立
  • 建议动作:① v37 接力棒把 arXiv:2607.12227 升级到 §2.3 候选新增第 67 行(评级 ★★★)+ 同步新增 §3.3 反方 #143 + §3.4 趋势 T100;② A1 触发动作 = v37 接力棒前 PDF 核验(作者是否在 WebArena / SWE-bench / GAIA-2 上做了复制 · 沿用 flyp 8-22 22:50 风险评估 §4 #1);③ A2 触发动作 = 撞名核验 ≥5 条("Rethinking" / "Harness Evolution" / "Budget Confound" / "Test-Time Scaling" / "Held-Out Generalization") 截止 8-28;④ A3 触发动作 = 与 v36 9 件立基础延展候选的反方对位矩阵 截止 9-1(v36 9 件 = Meta-Harness + Zetta ζ + CoEvoSkills + SemaPLC + SWE-bench Science + SkillGate + HarnessEval-W + HarnessRisk + StateM · arXiv:2607.12227 对每件的 setting 是否成立)。

增量 2 · HSI Hierarchical Self-Improvement = Harness 自演进谱系第 5 分支候选 ★★★(arXiv:2608.08466,tom 8-22 evaluation-e1prep,paper_card 1057 8-22 14:13 新建)

  • 来源:/shared/research-kb/organized/paper_cards/1057-2608-08466.md(paper_card 1057 8-22 14:13 新建 · 主分类 evaluation 副 agent)+ inbox/tom/2026-08-22-evaluation-e1prep.md 条目一(★ eval 专项 paper_card net-new ★★★ 立基础锚候选 + work-queue Top15 #1)+ inbox/spark/2026-08-22-agent-e1prep.md §增量 1(jay 1001-rss-lilian-weng 联动)+ inbox/jay/2026-08-22-1001-rss-lilian-weng.md RSS 摘要 + inbox/jay/2026-08-22-2105-jay-five-category-briefing.md BE-1 全文笔记 + inbox/tom/2026-08-22T0840-agent-rag-longcontext-radar.md HF Daily 8-22 早盘候选登记 + inbox/stephen/2026-08-22-ai-industry-e1prep.md §主线 HSI 沿用 + inbox/stephen/2026-08-22-llm-application-e1prep.md §1.1 立基础延展 HSI 沿用。arXiv:2608.08466 已核实(8-8 v1 · Hierarchical Self-Improvement: A Framework for Task-Specific Evolvable Agent Harnesses)。
  • 核心方案:HSI = Hierarchical Self-Improvement · 任务特定可进化 Agent Harness 分层框架 —— 现代 LLM Agent 通常通过人工修改 prompt / tool / workflow 改进,而 harness 在部署后通常被视为固定不变的——能否让 harness 任务特定且持续可进化?三层可进化 harness 框架:task harness → meta-harness → rewrite LLM(均由冻结 LLM M 驱动);每个任务族维护各自的 harness,通过固定任务注入接缝在迭代间热替换,并依据环境反馈改写
  • 关键贡献:① 首次提出任务特定 + 持续进化的 harness 替代方案(从「harness 是一次性部署产物」到「harness 是 per-task family 的可热替换组件」)② 三层架构(task harness → meta-harness → rewrite LLM · 单冻结 LLM M 驱动 = 避免端到端 RL 训练 harness 带来的算力成本)③ Hot-swap 接缝机制(固定任务注入接缝在迭代间热替换 harness + 基于环境反馈改写 = 与 Zetta ζ "harness 内组件自演化"形成"harness 自身重写 vs harness 内组件自演化"双轨)④ work-queue Top15 #1 候选(work-queue §3 #1 = 2608.08466 已登记)。
  • 与 Zetta ζ 的关系(关键):Zetta ζ 面向具身智能 runtime critics + recovery skills 自演化(arXiv:2608.16590 · harness 自演进谱系第 4 分支);HSI 面向通用 Agent 的任务特定可进化 harness(harness 自演进谱系第 5 分支);两者同属"harness 持续改进"方向但抽象层次不同 —— Zetta ζ = harness 内组件自演化(closed-loop physical intelligence) / HSI = harness 自身重写(general agent + task-specific hot-swap)stephen 8-22 ai-industry §3.4 趋势 T160 判定 = "Zetta ζ + HSI 双轨"。
  • 与 knowledge/coding-agents.md 现有脉络的关系:HSI 在 v36 coding-agents.md 主文件中只在「附录 arXiv 编号索引」出现(line 240,但不在 8-21 22:30 v36 主变更中 = v36 接力棒沿用 v35 §2.1 但 HSI 未独立成段 · spark 8-22 agent-e1prep §1 v55 已立 HSI 候选预备)。v37 接力棒应将其升级为 harness 自演进谱系第 5 分支(v36 已立 StateM/HarnessEval-W/HarnessRisk/Zetta ζ 4 分支 · HSI 第 5 分支 = 任务特定可进化 harness 通用 agent)。
  • 建议归入节:§2.3 评测基础设施分层候选新增第 68 行 = HSI(arXiv:2608.08466 · paper_card 1057 8-22 新建 · 主分类 evaluation 副 agent · 立标等级候选级中-高档 ★★ 候选预备 · 与 Zetta ζ 形成 harness 自演进谱系第 5 分支 · 跨实例 5+ 源 ✓ · 与 Zetta ζ ★★★ 中-高档同档 ★★★ 候选预备·与 Meta-Harness COLM 2026 + Task-CoEvolve + HarnessEval-W + HarnessRisk + Zetta ζ + SkillGate 形成"Harness 自演化立基础延展五联")+ §3.1 共识候选新增 #146 = HSI 任务特定可进化 Agent Harness = harness 自演进谱系第 5 分支立基础延展候选
  • 关键风险(待 v37 接力棒独立判定):① 任务特定 hot-swap 的 task family 边界划定(何时判定两个任务属于同一 task family · 边界过宽则 hot-swap 退化为 single harness;过窄则失去 hot-swap 意义)② Meta-harness 自身的演化机制(meta-harness 是固定的还是也会被 rewrite LLM 改写 · paper 是否给出 meta-harness 的 ablation)③ 三层架构冻结 LLM 驱动 vs 端到端 RL 的 tradeoff(冻结 LLM 降低算力成本但 harness 演化自由度受限)。
  • 建议动作:① v37 接力棒把 HSI 升级到 §2.3 候选新增第 68 行(评级候选级中-高档 ★★ 候选预备 · 待补 Zetta ζ 同档 ★★★ 裁定)+ 同步新增 §3.1 共识 #146 + §2.7 Agentic Engineering 学科化延展候选新增第 8 维;② A1 触发动作 = v37 接力棒前 PDF 核验 task family 边界 + meta-harness 演化机制 + 三层架构 ablation 截止 8-25;③ A2 触发动作 = 撞名核验 ≥5 条("HSI" / "Hierarchical Self-Improvement" / "Task-Specific Evolvable Harness" / "Hot-Swap" / "Rewrite LLM") 截止 8-30。

增量 3 · Task-CoEvolve + Lilian Weng Harness 工程专题原文 = harness 自演化立基础延展候选 ★★(arXiv:2608.20169,jay 8-22 1001-rss-lilian-weng,spark 8-22 agent-e1prep §1)

  • 来源:inbox/jay/2026-08-22-1001-rss-lilian-weng.md(1.4KB · Lilian Weng (Lil'Log) · 2026-07-04 Harness 工程专题原文 + Task-CoEvolve arXiv:2608.20169 引用)+ inbox/jay/2026-08-22-1001-rss-cool-papers.md(1.5KB · Task-CoEvolve 摘要)+ inbox/jay/2026-08-22-2105-jay-five-category-briefing.md BE-1(Lilian Weng Harness 工程全文笔记)+ inbox/jay/2026-08-22T2105 BE-5(Task-CoEvolve 联动)+ inbox/spark/2026-08-22-agent-e1prep.md §增量 1(jay 8-22 1001-rss-lilian-weng + Lilian Weng 全文笔记)+ inbox/tom/2026-08-22T0840-agent-rag-longcontext-radar.md 候选登记。arXiv:2608.20169 已核实(2026-08 发布 · Task-CoEvolve: 自适应验证任务选择高效 Harness 优化 · paper_card 待建 P1 缺口 · spark agent-e1prep §1 P1 触发动作)。
  • 核心方案:Task-CoEvolve = 自适应验证任务选择 → 高效 Harness 优化 = Harness 优化通过迭代重写 Harness 代码库 + 自适应验证任务 = Harness 自演化的工程级实现Lilian Weng Harness 工程专题原文(2026-07-04 发布 · 引用 Task-CoEvolve)从 RSI 范式级视角给出:Harness = 测试/评估框架,RSI 中 Agent 自己改进 Harness 提示词,形成正向循环;核心机制 = Agent 重写 Harness → 重新评估 → 验证改进 → 迭代收敛;与传统 RLHF 对比 = RSI 不依赖人工设计 reward,而是让 Agent 自主发现 Harness 漏洞。
  • 关键贡献:① Lilian Weng 顶级博客引用 + 2026-07-04 Harness 工程专题原文(OpenAI 前研究员背书 · AI Safety + Agent Engineering 交叉前沿)② Task-CoEvolve 与 HSI 形成 harness 自演化方向互补(HSI 偏 hot-swap / Task-CoEvolve 偏自适应验证任务选择)③ 与 Meta-Harness arXiv:2603.28052 + SWE-bench Pro Harness 量化 + HarnessEval-W arXiv:2608.16859 + HarnessRisk arXiv:2608.17597 + Zetta ζ arXiv:2608.16590 + HSI arXiv:2608.08466 + CoEvoSkills arXiv:2604.01687 形成 "Harness 自演化立基础延展五联"(spark §3.1 共识 #201)
  • 与 knowledge/coding-agents.md 现有脉络的关系:Lilian Weng Harness 工程专题原文 2026-07-04 发布(v55 cutoff 8-22 10:30 前),但 v36 主文件未独立成段(沿用 v35 Lilian Weng 文章锚);Task-CoEvolve 2026-08 发布,v36 主文件未独立成段v37 接力棒应将其升级为 harness 自演化立基础延展第 6 分支候选(v36 5 件 + HSI + Task-CoEvolve + Lilian Weng 原文 = 8 件)。
  • 建议归入节:§2.1 Harness 学术化候选新增第 97 栖 = Task-CoEvolve + Lilian Weng Harness 工程专题原文(arXiv:2608.20169 + lilianweng.github.io/posts/2026-07-04-harness/ · paper_card 待建 P1 · 立标等级候选级中-高档 ★★ 候选预备 · 跨实例 5+ 源 ✓ · 与 HSI + Zetta ζ + Meta-Harness 形成 "Harness 自演化立基础延展五联")+ §3.1 共识候选新增 #147 = Task-CoEvolve 自适应验证任务选择 + Lilian Weng Harness 工程专题原文 = harness 自演化的工程级实现 + 范式级引用立基础延展候选
  • 关键风险:① Task-CoEvolve 摘要级未提供完整实验数字(与 HSI / Meta-Harness 等基线对比的具体数字 + 9.0 分 / 步数等关键数字缺失)② Lilian Weng 原文 2026-07-04 发布但任务通过 8-22 RSS 摘要触发(原文发布日期早于 v55 cutoff,但 Lilian Weng 文章引用 Task-CoEvolve + 与 HSI 联动属于"v55 立标信号沿用"的细化)。
  • 建议动作:① v37 接力棒把 Task-CoEvolve + Lilian Weng Harness 工程专题原文升级到 §2.1 候选新增第 97 栖(评级候选级中-高档 ★★ 候选预备)+ 同步新增 §3.1 共识 #147 + §3.4 趋势 T160 细化(RSI = Harness 自演化 = Agent 自主发现 Harness 漏洞);② A1 触发动作 = v37 接力棒前 paper_card 新建 P1 缺口补建 截止 8-25;③ A2 触发动作 = PDF 核验 Task-CoEvolve 实验数字 截止 8-30;④ A3 触发动作 = 撞名核验 ≥5 条("Task-CoEvolve" / "CoEvolve" / "Lilian Weng Harness" / "Self-Improving Harness" / "RSI") 截止 9-1;⑤ A4 触发动作 = 与 HSI / Zetta ζ / Meta-Harness / CoEvoSkills 联动(同一作者群?方法论互补?方向冲突?)截止 9-5。

增量 4 · EnvHarness arXiv:2608.19880 = 评测方法学延革第 12 例反方立基础候选预备(tom 8-22 evaluation-e1prep,flyp 8-22 multimodal-e1prep / EnvHarness-and-4DAnyone critical-read,stephen 8-22 ai-industry-e1prep,8-22 主分类 evaluation 副 multimodal 判定)

  • 来源:/shared/research-kb/inbox/flyp/2026-08-22-EnvHarness-and-4DAnyone-critical-read.md(19.9KB · 主分类 evaluation 副 multimodal 判定 · 评测方法学延革第 12 例反方立基础候选预备 · 立标等级候选级中-高档 ★★ 候选预备 · flyP 偏"中-高档 ★★"而非"高档 ★★★",因为 ① EnvRigger 自身可靠性未量化 ② +9.0 分原始 baseline 待核 ③ Link 组件边界需论证)+ inbox/flyp/2026-08-22-1030-sat-weekly-deep-read-summary.md 立标等级维持 + inbox/flyp/2026-08-22-multimodal-e1prep.md §1 矛盾 1 判定(主分类 evaluation 副 multimodal)+ inbox/tom/2026-08-22-evaluation-e1prep.md 条目二(EnvHarness 235▲ HF Daily 8-22 #1 = eval 邻接候选 ★★★)+ inbox/tom/2026-08-22-0900-hf-daily-2026-08-22.md 8-22 早盘 #1 235▲ 极显著(超 v53 沿用 StateM 374▲ 8-20 早盘 24h 实测的 235▲ < 374▲ 但 8-22 早棒实际票数过 235▲ 为 v33 以来单日早盘实测 #2 高位)+ inbox/stephen/2026-08-22-ai-industry-e1prep.md §主线 5 benchmark 列表核对 P0 + §主线 EnvHarness 归属统一 P0 + inbox/stephen/2026-08-22-llm-application-e1prep.md §1.1 立基础延展 EnvHarness 沿用 + inbox/stephen/2026-08-22-2245-stephen-coordination-check-evening.md §3.4 EnvHarness 5 benchmark 列表 OfficeQA 疑似错记 P0。arXiv:2608.19880 已核实 · paper_card 未建 P1 缺口(沿用 v36 缺口)。
  • 核心方案:EnvHarness = Environment Harness · 唤醒静态世界以支持 Agent 学习 —— 将现有环境改造为可感知 Agent 弱点的动态 harness;不需要领域特定管道,不依赖昂贵或不可靠的验证器;核心抽象 = 一层可编程插件(Setup / Rule / Link 三件)+ EnvRigger = LLM 设计师 agent(黑盒观察 agent 执行轨迹 → 诊断弱点 → 写组件 → 测试 → 修订);评测域 = ALFWorld(具身 household)+ WebArena(web agent)+ SWE-bench Verified(代码)+ OfficeQA(办公)+ SpreadsheetBench(办公);实测 +9.0 分 / -9.8% 步数 / Link 组件边界 + RL co-evolution 收敛性
  • 关键贡献:① 首次提出"环境唤醒 + 静态世界动态化"评测范式(与现有 "benchmark 静态数据集" 维度形成对照)② EnvRigger LLM 设计师 agent(黑盒观察 + 诊断弱点 + 写组件 + 测试 + 修订 = harness 化的环境端实现)③ 三插件组件(Setup / Rule / Link · 三件一组 · 每件独立可重写)④ Google Research 出品(google-research 团队 · 含 Chen-Yu Lee / Tomas Pfister senior)+ github.com/google-research/envharness(8-21 release)+ envharness.com。
  • 关键区分(与 Zetta ζ / HSI):① Zetta ζ 是在线演化 runtime critics(arXiv:2608.16590 · harness 内组件自演化);EnvHarness 是唤醒/改造静态环境本身(评测环境动态化)② HSI 是 harness 自身重写(arXiv:2608.08466 · harness 自演进谱系第 5 分支);EnvHarness 是 harness 化的环境端实现(harness 化的评测环境)。三者形成 harness 自演进 + 环境 harness 化双轨:Zetta ζ = harness 内组件自演化 / HSI = harness 自身重写 / EnvHarness = 环境 harness 化。
  • 立标等级升级判定(沿用 v36 §3.1 共识预备):flyp 8-22 multimodal-e1prep §3 矛盾 1 判定 + flyp 8-22 1030-sat-weekly-deep-read-summary §5 决策 1 = 建议主分类 evaluation 副分类 multimodal(沿用 flyp 8-20 multimodal-e1prep 矛盾 6 "Large Discovery Models 主分类 multimodal vs evaluation 标签冲突" 同类判例)· v37 接力棒必须独立判定主分类归 multimodal 还是 evaluation(沿用 flyp 8-20 multimodal-e1prep 矛盾 6 同类判例 · 建议主分类 evaluation 副分类 multimodal)。
  • 与 knowledge/coding-agents.md 现有脉络的关系:EnvHarness 在 v36 coding-agents.md 主文件中未出现(只在 llm-application / agent / multimodal 等邻接活文档沿用)。v37 接力棒应将其纳入 coding-agents 主轴邻接级 §2.3 评测基础设施分层候选(沿用 tom 8-22 evaluation-e1prep §条目二 + flyp 8-22 multimodal-e1prep §1 矛盾 1 判定)。
  • 建议归入节:§2.3 评测基础设施分层候选新增第 69 行 = EnvHarness(arXiv:2608.19880 · paper_card 未建 P1 缺口 · 主分类 evaluation 副 multimodal · 立标等级候选级中-高档 ★★ 候选预备 · 与 Zetta ζ + HSI 形成"harness 自演化 + 环境 harness 化"双轨 · 立标信号 8-22 早棒 #1 235▲ 极显著 · 立标池双向锚 v33 以来 24h 窗口 multimodal 主分类 / 邻接级立标信号最高位实测 #1 = v33 以来首次 "评测方法学延革" + "Agent 评测" + "动态世界" 三维度锚定 · 评测方法学延革第 12 例反方立基础候选预备)+ §3.1 共识候选新增 #148 = EnvHarness 唤醒静态世界以支持 Agent 学习 = 评测方法学延革第 12 例反方立基础候选预备
  • 关键风险(待 v37 接力棒独立判定):① 主分类 evaluation vs multimodal 争议(沿用 flyp 8-20 multimodal-e1prep 矛盾 6 同类判例 · 建议主分类 evaluation 副分类 multimodal)② "唤醒静态世界"具体技术路径(环境生成 / 状态机可交互 / 多模态反馈 三种 trade-off)③ 与 VibeWorlding 2616 资产 + 6828 反向合成 query 是否同维度(若重叠则 EnvHarness 应降级为 VibeWorlding 子项)④ EnvHarness 5 benchmark 列表 OfficeQA 疑似错记(stephen 8-22 2245 evening §3.4 P0 · 待补查)⑤ EnvRigger 自身可靠性未量化+9.0 分原始 baseline 待核Link 组件边界需论证RL co-evolution 收敛性
  • 建议动作:① v37 接力棒把 EnvHarness 纳入 §2.3 候选新增第 69 行(评级候选级中-高档 ★★ 候选预备)+ 同步新增 §3.1 共识 #148 + §2.7 Agentic Engineering 学科化延展候选新增第 12 维延展;② A1 触发动作 = paper_card 新建 P1 缺口补建 截止 8-25;③ A2 触发动作 = PDF 核验 OfficeQA 5 benchmark 列表 + EnvRigger 自身可靠性 + +9.0 分原始 baseline 截止 8-30;④ A3 触发动作 = 与 VibeWorlding 同维度核对 截止 9-1。

增量 5 · QuoteBench arXiv:2608.13547 paper_card 1056 8-22 新建 = coding-agents 主轴邻接级 评测方法学延展(tom 8-22 evaluation-e1prep 条目五)

  • 来源:/shared/research-kb/organized/paper_cards/1056-2608-13547.md(paper_card 1056 8-22 新建 · 主分类 agent 副 evaluation · work-queue Top15 #2 0.5 优先级)+ inbox/tom/2026-08-22-evaluation-e1prep.md 条目五(命令路径失败评测)+ inbox/tom/2026-08-22-rag-e1prep.md 沿用 + inbox/tom/2026-08-22T0840-agent-rag-longcontext-radar.md 候选登记。arXiv:2608.13547 已核实。
  • 核心方案:QuoteBench = 命令执行边界量化(terminal Agent 可审计评测方法 · 与 FACET 配对形成"合成端 + 评测端"完整图谱);关键发现 = 匹配得分如何掩盖命令路径失败(matching scores can mask command path failures)· = 评测方法学的盲点:即使匹配得分高,也可能掩盖命令路径失败 = coding-agents 主轴的「命令执行安全 + 可审计性」评测。
  • 与 knowledge/coding-agents.md 现有脉络的关系:QuoteBench 在 v36 coding-agents.md 主文件中未出现v37 接力棒应将其纳入 coding-agents 主轴邻接级 §2.3 评测基础设施分层(work-queue Top15 #2 候选登记)。
  • 建议归入节:§2.3 评测基础设施分层候选新增第 70 行 = QuoteBench(arXiv:2608.13547 · paper_card 1056 8-22 新建 · 主分类 agent 副 evaluation · 立标等级候选级中档 ★ 候选 · work-queue Top15 #2 · 跨实例 2 源 ✓)· 与 FACET 配对形成"合成端 + 评测端"完整图谱)+ §3.3 反方候选新增 #144 = QuoteBench = coding-agents 主轴 8-22 首次「匹配得分掩盖命令路径失败」反方立基础候选
  • 建议动作:① v37 接力棒把 QuoteBench 纳入 §2.3 候选新增第 70 行(评级候选级中档 ★ 候选)+ 同步新增 §3.3 反方 #144;② A1 触发动作 = PDF 核验 命令路径失败分类 + 评测指标 截止 8-30;③ A2 触发动作 = 与 FACET head-to-head 实测覆盖度 截止 9-1。

增量 6 · BrowseComp-Plus → ClimbMix 编号错 P0(spark 8-22 agent-e1prep §主线 #3 · stephen 8-22 2245 evening §3.1 P0)

  • 来源:inbox/spark/2026-08-22-agent-e1prep.md §主线 #3(BrowseComp-Plus → ClimbMix 错配)+ inbox/stephen/2026-08-22-2245-stephen-coordination-check-evening.md §3.1(stephen-on-spark 8-22 评审 7 分发现)+ inbox/jay/2026-08-22-1001-rss-cool-papers-ir.md BrowseComp-Plus 错登记 · 影响范围:spark 8-22 agent-e1prep §主线 #3 + Stephen llm-application §主线 5 已引用此错编号 + jay engineering-e1prep 沿用 spark 标注 + jay database-e1prep 边缘邻接 BrowseComp-Plus → ClimbMix 同样错。
  • 核心错误:spark 8-22 agent-e1prep 把 BrowseComp-Plus 标为 arXiv:2608.20317,但 arXiv 上 2608.20317 是另一篇完全不同主题的论文;真实编号 = arXiv:2508.06600(BrowseComp-Plus: A More Fair and Transparent Evaluation Benchmark of Deep-Research Agent · ACL 2026 long.1023);Tevatron/browsecomp-plus 数据集已开源于 HF;ClimbMix 实为 NVIDIA 2024 的预训练数据集(250B tokens · arXiv:2403.07652),与 BrowseComp-Plus 是两个独立工作,非同一论文的"BrowseComp-Plus → ClimbMix"接力关系。
  • P0 修复:spark v47 接力棒必须修正 arXiv:2608.20317arXiv:2508.06600,并删除"ClimbMix 是 BrowseComp-Plus 的下游扩展"虚构关联 + Stephen v61 接力棒同步修正(待 §主线 5 复用时)+ Jay v60 engineering-e1prep / v43 database-e1prep 同步修正(待 v60 援引时)+ 本 evening 棒已在 §3.1 标注此 P0 警示,避免今晚 v56 / v60 / v43 接力棒继续继承。
  • 与 coding-agents 主轴的关联:虽 BrowseComp-Plus 本身是 Deep-Research Agent benchmark 与 coding-agents 主轴邻接级(deep research + coding agent 重叠),但编号错 P0 是「P0 跨实例污染事件」登记,与 coding-agents 主轴方法学相关。
  • 建议归入节:§3.3 反方候选新增 #145 = BrowseComp-Plus 编号错 P0 = v37 接力棒必须修复

增量 7(沿用补强) · v36 立基础延展候选的 8-22 续立与立标信号微强

  • 来源:inbox/tom/2026-08-22-0900-hf-daily-2026-08-22.md 8-22 早盘 15 件 + inbox/tom/2026-08-22-evaluation-e1prep.md §结尾 立标池双向锚第 9 日。
  • 沿用事实:① EnvHarness 8-22 首日登顶 235▲(HF Daily #1)·超越 Zetta ζ 140▲ / SemComp-Bench 155▲ 成为新晋锚(详 §增量 4)② Zetta ζ 8-22 140▲(HF Daily 沿用 v36)③ SemComp-Bench 8-22 155▲(HF Daily 沿用 v36)④ SemaPLC 8-21 111▲ (#4)→ 8-22 114▲ (#4) = 延续信号 +3▲,维持高位(沿用 v36)⑤ SWE-bench Science 8-21 邻接 → 8-22 56▲ (#9) = 新晋邻接锚(沿用 v36)⑥ ASI-Bench 8-22 跌出 top 15(连续两日攀升后衰减确认)⑦ Co-RL 107▲ 新晋邻接(沿用 v36)⑧ QuoteBench 8-22 paper_card 1056 新建(详 §增量 5)。
  • 立标池双向锚第 9 日:EnvHarness 235▲ 新锚登顶 + SemComp-Bench / Zetta ζ / SemaPLC 三件延续高位 + ASI-Bench 衰减确认 + FACET / SWE-bench Science / Co-RL 三件新晋邻接 = 立标池饱和度供给侧第 11 日延续
  • 建议归入节:无新增(沿用 v36 §1.4 立标池状态机 + §3.1 共识 #140-145)。

二、与活文档 knowledge/coding-agents.md 现有脉络的关系(汇总)

v36 第三十六棒(8-22 04:20 夜间活文档 · 8-21 22:30 CST 窗口)状态:25 件延展候选,主轴 0 件净增饱和延展期判定,邻接级 5 件(Zetta ζ + CoEvoSkills + SemaPLC + SWE-bench Science + SkillGate),3 件产业级(TrueForge + Stampli + Anthropic Claude Code),1 件范式延续(立标池 StateM 跌出 + Demystifying Agent Skills 接管),1 件补回(MSR Echoverse),8 件 P0 新增警示。

本棒 8-22 23:20 CST 截止增量 = 5 件(3 件 net-new 邻接级 + 2 件延展候选升级 + 1 件 P0 编号错 + 1 件沿用补强):

# 增量 arXiv / 来源 类别 立标等级候选 归入节
1 Harness 评测协议失真立基础延展候选(arXiv:2607.12227) flyp 8-22 22:50 critical-read 邻接级 net-new ★★★ ★★★ 中-高档 §2.3 第 67 行 + §3.3 #143 + §3.4 T100
2 HSI 任务特定可进化 Agent Harness arXiv:2608.08466 · paper_card 1057 8-22 新建 邻接级 net-new ★★★ ★★ 中-高档 候选预备 §2.3 第 68 行 + §3.1 #146
3 Task-CoEvolve + Lilian Weng Harness 工程专题原文 arXiv:2608.20169 + lilianweng.github.io/posts/2026-07-04-harness/ 邻接级 net-new ★★ ★★ 中-高档 候选预备 §2.1 第 97 栖 + §3.1 #147
4 EnvHarness 唤醒静态世界以支持 Agent 学习 arXiv:2608.19880 · HF Daily 8-22 #1 235▲ 邻接级 net-new ★★ 中-高档 候选预备 §2.3 第 69 行 + §3.1 #148
5 QuoteBench 命令路径失败评测 arXiv:2608.13547 · paper_card 1056 8-22 新建 · work-queue Top15 #2 邻接级 net-new ★ 中档 §2.3 第 70 行 + §3.3 #144
6 BrowseComp-Plus 编号错 P0 arXiv:2508.06600(实际)/ 2608.20317(错) P0 跨实例污染 N/A §3.3 #145
7 v36 立基础延展候选的 8-22 续立与立标信号微强 HF Daily 8-22 早盘 15 件 沿用补强 沿用 v36 §1.4 沿用

v37 接力棒建议净增候选清单: - §2.3 评测基础设施分层候选新增第 67 → 68 → 69 → 70 行(Rethinking Harness Evolution + HSI + EnvHarness + QuoteBench 四联立基础延展 + 评测方法学延展)= v37 候选新增 4 行(与 v36 候选新增 3 行 + 沿用第 62-66 行 总共 7 行) - §2.1 Harness 学术化候选新增第 97 栖(Task-CoEvolve + Lilian Weng Harness 工程专题原文)→ v37 候选新增 1 栖(与 v36 候选新增 5 栖 总共 6 栖) - §2.7 Agentic Engineering 学科化延展候选新增第 15 → 16 维延展(HSI 任务特定可进化 + EnvHarness 评测方法学延革第 12 例反方预备)→ v37 候选新增 2 维延展 - §3.1 共识候选新增 #146 → #147 → #148(HSI + Task-CoEvolve + EnvHarness)→ v37 候选新增 3 件共识(与 v36 候选新增 6 件 = #140-145 总共 9 件) - §3.3 反方候选新增 #143 → #144 → #145(Harness Evolution 评测协议失真 + QuoteBench 命令路径失败 + BrowseComp-Plus 编号错 P0)→ v37 候选新增 3 件反方(与 v36 候选新增 8 件 = #135-142 总共 11 件) - §3.4 趋势候选新增 T100(Harness 自演化的预算可控性 + 评测协议失真 = coding-agents 主轴 8-22 立基础延展候选方法学反思) - §6.1 必读清单 +0 件 arXiv(沿用 v36 323 件 + 8-22 立基础延展候选已在沿用范围 arXiv:2607.12227 + 2608.08466 + 2608.19880 + 2608.13547 · 沿用补强,不增加 arXiv 净数) - 合计 v37 净增候选 = 4(§2.3) + 1(§2.1) + 2(§2.7) + 3(§3.1) + 3(§3.3) + 1(§3.4) = 14 件延展候选(与 v36 净增 25 件相比 -11 件 · 主轴饱和延展期第 5 日延续 + 邻接级显著补给窗口 5 日连续)


三、值得警惕的矛盾或待核实说法(6 件 P0 + 2 件沿用)

矛盾 1 🔴 · Harness 评测协议失真立基础延展候选的「论点循环」风险(flyp 8-22 22:50 §4 #3 沿用)

stephen 8-22 2245 evening §C 沿用 + flyp 8-22 22:50 §4 实验风险 #3 自行警示:arXiv:2607.12227 作者用「没有 unit-test feedback 时输给 parallel sampling」做主要论点;但 harness evolution 的卖点从来就是「没有 verifier 时也能改」—— 这个 setting 里它反而天然会弱一些,论据有点循环待核:① 作者是否在所有 setting(有 unit-test + 无 unit-test + dense + sparse feedback)都给出 head-to-head;② v36 9 件立基础延展候选(Meta-Harness + Zetta ζ + CoEvoSkills + SemaPLC + SWE-bench Science + SkillGate + HarnessEval-W + HarnessRisk + StateM)对 arXiv:2607.12227 的反方挑战是否在每个 setting 都成立;③ v37 接力棒必须独立判定 arXiv:2607.12227 的反方挑战是否在所有 setting 都成立(立标等级是否应降级 ★★★ → ★★)。

矛盾 2 🔴 · BrowseComp-Plus 编号错 P0 跨实例污染事件(stephen 8-22 2245 evening §3.1 P0)

spark 8-22 agent-e1prep 把 BrowseComp-Plus 标为 arXiv:2608.20317,但 arXiv 上 2608.20317 是另一篇完全不同主题的论文;真实编号 = arXiv:2508.06600(BrowseComp-Plus: A More Fair and Transparent Evaluation Benchmark of Deep-Research Agent · ACL 2026 long.1023);Tevatron/browsecomp-plus 数据集已开源于 HF;ClimbMix 实为 NVIDIA 2024 的预训练数据集(250B tokens · arXiv:2403.07652),与 BrowseComp-Plus 是两个独立工作P0 修复:spark v47 接力棒必须修正 arXiv:2608.20317arXiv:2508.06600,并删除"ClimbMix 是 BrowseComp-Plus 的下游扩展"虚构关联 + Stephen v61 接力棒同步修正 + Jay v60 engineering-e1prep / v43 database-e1prep 同步修正。

矛盾 3 🟡 · SoK Agentic RAG 编号缺 P1(stephen 8-22 2245 evening §3.2 P1)

spark 8-22 agent-e1prep 引用 SoK Agentic RAG Mishra et al. ACL 2026 时只列 Semantic Scholar ID(e23f86a30...),未给 arXiv 编号;真实编号 = arXiv:2603.07379(Saroj Mishra / Suman Niroula / Umesh Yadav / Dilip Thakur / Srijan Gyawali / Shiva Gaire · arXiv 2026-03-07 提交)。P1 修复:spark / Stephen / Jay 接力棒补查并标注 arXiv:2603.07379

矛盾 4 🟡 · P1 paper_card 缺口数 13 vs 15 vs 19 vs 23 口径不一(stephen 8-22 2245 evening §3.3 P0 · jay-on-stephen 评审 7.5 分发现)

Stephen ai-industry-e1prep §一 总览说"15 件 net-new + 续立";§三 矛盾 5 说"v55 接力棒前必须强制补建 8 件 paper_card";§六 检查过的来源汇总说"19 件 P1 缺口未建累积";§五 接力棒动作 #6 又说"23 件总计" = 这是整篇最容易产生误读的数字。P0 修复:stephen-on-spark v53 接力棒同步修订 §六 P1 paper_card 缺口数为统一口径;§六 用一张单一表格给出 v52 evening 棒遗留 + 8-22 早棒 net-new + 8-22 radar 三组合并清单,附小计 = 19 vs 23 的口径说明("19 = 待补建 P1 缺口;23 = 含 8-22 沿用件 + 待补建合并数")。

矛盾 5 🟡 · EnvHarness 5 benchmark 列表 OfficeQA 疑似错记(stephen 8-22 2245 evening §3.4 P0 · jay-on-stephen 评审 7.5 分发现)

OfficeQA 在 EnvHarness 5 benchmark 列表中位置可疑 · 待补查 flyp 8-22 EnvHarness-and-4DAnyone-critical-read §1.1 PDF 核验。P0 修复:v37 接力棒前 PDF 核验 OfficeQA 5 benchmark 列表 + 实际任务分布。

矛盾 6 🟡 · EnvHarness 主分类 evaluation vs multimodal 争议(flyp 8-22 multimodal-e1prep §1 矛盾 1)

flyp 8-22 multimodal-e1prep §3 矛盾 1 判定 + flyp 8-22 1030-sat-weekly-deep-read-summary §5 决策 1 = 建议主分类 evaluation 副分类 multimodal(沿用 flyp 8-20 multimodal-e1prep 矛盾 6 "Large Discovery Models 主分类 multimodal vs evaluation 标签冲突" 同类判例);v37 接力棒必须独立判定主分类归 multimodal 还是 evaluation;若主分类 = multimodal 则 v37 接力棒必须独立判定"评测方法学延革第 12 例"预备是否升级 → "评测方法学延革"主轴与 multimodal 主轴的"边界测试"第 1 例

矛盾 7 🔴 · CoEvoSkills verifier 可靠性未量化(沿用 v36 P0-18)

flyp 8-21 critical-read §A 主要问题 #2 沿用 —— 作者声称 verifier 在没有 ground-truth 时也能给出 actionable feedback,但没有报告 verifier 自身的校准曲线、误报率、与真实 verifier 的一致性待核 PDF §5 verifier prompt + §附录校准曲线。沿用 SCA A1-A6 模板 A1-A6 触发动作(沿用 v36)。

矛盾 8 🔴 · CoEvoSkills SkillsBench 85-task 样本量偏小(沿用 v36 P0-19)

flyp 8-21 critical-read §A 主要问题 #4 沿用 —— 摘要里没有强调 bootstrap / 多 seed;EvoSkills 在更广泛任务(浏览器 / 长对话 / 企业数据管道)上的可移植性证据不足待核 PDF §4 置信区间 + 多 seed 实验。

矛盾 9(可选 · 不计入 P0)· 立标池双向锚 StateM 8-22 跌出后续立(8-22 沿用)

StateM 8-20 #1 374▲ → 8-21 早盘跌出 → 8-22 仍未进前 15(沿用 v36)· Demystifying Agent Skills 154▲ 8-21 #1 → 8-22 早盘未进前 15(沿用 v36)· EnvHarness 8-22 #1 235▲ = 新锚登顶 + Zetta ζ 8-22 140▲ + SemComp-Bench 8-22 155▲ + SemaPLC 8-22 114▲ 续立高位 + ASI-Bench 8-22 跌出 top 15 = 立标池双向锚第 9 日持续实测 + 反向补给窗口 5 日连续


四、可引用 arXiv 号列表(本棒 8-22 23:20 CST 截止 coding-agents 主轴相关,按 §1 增量顺序去重)

  1. arXiv:2607.12227Rethinking the Evaluation of Harness Evolution for Agents · Yike Wang / Huaisheng Zhu / Zhengyu Hu / Yige Yuan / Zhengyu Chen / Shakti Senthil / Hannaneh Hajishirzi / Yulia Tsvetkov / Pradeep Dasigi / Teng Xiao · Allen Institute for AI / UW / Independent · 2026-07-14 v1 · 代码 github.com/rethinking-harness-evolution 公开 · paper_card 434 7-20 已建 · 主分类 evaluation 副 agent · v31 §1.2 Reliability 三十维沿用 + 7-21 coding-agents §2.1 Harness 自演化立基础沿用引用 + 8-22 flyp critical-read 升级到 §2.3 评测基础设施分层候选新增第 67 行 · 立标等级 ★★★ 中-高档 · v37 接力棒候选新增*
  2. arXiv:2608.08466Hierarchical Self-Improvement: A Framework for Task-Specific Evolvable Agent Harnesses · 2026-08-08 v1 · paper_card 1057 8-22 14:13 新建 · 主分类 evaluation 副 agent · 三层架构 task harness → meta-harness → rewrite LLM · task-specific hot-swap · work-queue Top15 #1 · 立标等级 ★★ 中-高档 候选预备 · v37 接力棒候选新增
  3. arXiv:2608.20169Task-CoEvolve: 自适应验证任务选择高效 Harness 优化 · Lilian Weng Harness 工程专题原文 2026-07-04 引用 + 8-22 RSS 摘要触发 · paper_card 待建 P1 缺口 · 立标等级 ★★ 中-高档 候选预备 · 跨实例 5+ 源 ✓ · v37 接力棒候选新增
  4. arXiv:2608.19880EnvHarness: 唤醒静态世界以支持 Agent 学习 · Google Research 出品 · paper_card 未建 P1 缺口 · 主分类 evaluation 副 multimodal · HF Daily 8-22 #1 235▲ 极显著 · 评测方法学延革第 12 例反方立基础候选预备 · 立标等级 ★★ 中-高档 候选预备 · 跨实例 3+ 源 ✓ · v37 接力棒候选新增
  5. arXiv:2608.13547QuoteBench: 命令路径失败评测 · paper_card 1056 8-22 新建 · 主分类 agent 副 evaluation · work-queue Top15 #2 · 命令执行边界量化 · 立标等级 ★ 中档 · 跨实例 2 源 ✓ · v37 接力棒候选新增
  6. arXiv:2508.06600BrowseComp-Plus: A More Fair and Transparent Evaluation Benchmark of Deep-Research Agent · ACL 2026 long.1023 · Tevatron/browsecomp-plus 数据集开源 HF · spark 8-22 agent-e1prep §主线 #3 错登记为 arXiv:2608.20317 · P0 跨实例污染事件 · stephen 8-22 2245 evening §3.1 P0 修复 · v37 接力棒必须修正编号错 · 【P0 警示】
  7. arXiv:2603.07379SoK Agentic RAG Mishra et al. ACL 2026 · Saroj Mishra / Suman Niroula / Umesh Yadav / Dilip Thakur / Srijan Gyawali / Shiva Gaire · 2026-03-07 提交 · spark 8-22 agent-e1prep 编号缺 P1 · stephen 8-22 2245 evening §3.2 P1 修复 · 【P1 警示】

沿用 arXiv(本棒 v36 已立 coding-agents 主轴相关,8-22 续立微强): - arXiv:2608.16590(Zetta ζ · 8-22 140▲ 续立 · HF Daily 沿用 v36 · 立基础延展候选 #92 栖 · ★★★ 中-高档) - arXiv:2608.18565(SemaPLC · 8-22 114▲ 续立 +3▲ · HF Daily #4 · 立基础延展候选 #94 栖 · ★★ 中档) - arXiv:2608.19799(SWE-bench Science · 8-22 56▲ 新晋邻接 · HF Daily #9 · 立基础延展候选 #95 栖 · ★★★ 中-高档) - arXiv:2604.01687(CoEvoSkills / EvoSkills · COLM 2026 · paper_card 待建 P1 · 立基础延展候选 #93 栖 · ★★ 中档) - arXiv:2608.18852(SkillGate · paper_card 1032 已建 · 立基础延展候选 #96 栖 · ★★ 中档 · work-queue Top15 #3) - arXiv:2608.14036(Demystifying Agent Skills · 立标池锚 v33 以来首次"替代品接管"实测 · ★★ 中档) - arXiv:2608.15089(StateM · 8-20 #1 374▲ 跌出 + 8-22 仍未进前 15 · 立基础延展候选 · ★★★ 中-高档) - arXiv:2603.28052(Meta-Harness · COLM 2026 · 立基础延展候选 · ★★★ 中-高档 · Harness 自演化立基础延展五联第 1 件) - arXiv:2608.16859(HarnessEval-W · 立基础延展候选 · ★★★ 中-高档) - arXiv:2608.17597(HarnessRisk · 立基础延展候选) - arXiv:2607.28074(MSR Echoverse · RLE-by-construction · 立基础延展候选 #80 件套 · 沿用补回) - arXiv:2608.14905(AutoResearch / ARFT · 立基础延展候选) - arXiv:2608.17253(Co-RL · 8-22 90▲ 新晋邻接) - arXiv:2608.18580(FACET · HF Daily 8-22 #5 107▲ · 立基础延展候选 · 命令执行边界合成端) - arXiv:2608.20202(MemTrapBench · HF Daily 8-22 #13 29▲ · 立基础延展候选) - arXiv:2608.20246(Arabic Fiqh RAG · 立基础延展候选) - arXiv:2608.15767(TinyCast · 立基础延展候选) - arXiv:2608.16885(τ_0-VLA · 立基础延展候选) - arXiv:2607.21596(FlowEvo · 立基础延展候选) - arXiv:2608.12875(Embedder's Dilemma · 立基础延接级) - arXiv:2608.19857(Inadvertent Context Leakage · UCB/微软 · 立基础延接级) - arXiv:2608.13120(SkillEvo · 沿用 v36) - arXiv:2608.14022(ForgeWM · 立基础延接级) - arXiv:2608.13552(PlayWorld · 沿用 v36)


五、建议归入节汇总(供 v37 接力棒使用)

  • §1 一、现状全景:候选新增 8-22 22:45 evening 协调棒判定 + 8-22 主轴饱和延展期第 5 日延续 + 新增 5 件 net-new 邻接级(Harness Evolution + HSI + Task-CoEvolve + EnvHarness + QuoteBench)+ 1 件 P0 编号错(BrowseComp-Plus)+ 1 件沿用补强(v36 立基础延展候选续立)
  • §2.1 Harness 学术化:候选新增第 97 栖(Task-CoEvolve + Lilian Weng Harness 工程专题原文)= 1 栖候选新增
  • §2.3 评测基础设施分层:候选新增第 67 → 68 → 69 → 70 行(Rethinking Harness Evolution + HSI + EnvHarness + QuoteBench 四联立基础延展 + 评测方法学延展)= 4 行候选新增
  • §2.7 Agentic Engineering 学科化:候选新增第 15 维延展(HSI 任务特定可进化)+ 第 16 维延展(EnvHarness 评测方法学延革第 12 例反方预备)= 2 维延展候选新增
  • §3.1 共识:候选新增 #146(HSI)+ #147(Task-CoEvolve + Lilian Weng)+ #148(EnvHarness)= 3 件候选新增
  • §3.3 反方:候选新增 #143(Harness Evolution 评测协议失真)+ #144(QuoteBench 命令路径失败掩盖)+ #145(BrowseComp-Plus 编号错 P0)= 3 件候选新增
  • §3.4 趋势:候选新增 T100(Harness 自演化的预算可控性 + 评测协议失真 = coding-agents 主轴 8-22 立基础延展候选方法学反思)
  • §4 开放问题:候选新增 #137(Harness Evolution 评测协议失真 + 论点循环风险 + 9 件立基础延展候选反方对位矩阵·沿用 flyp 8-22 22:50 §4)
  • §6.1 必读清单:+0 件 arXiv 净数(沿用 v36 323 件 + 8-22 立基础延展候选 arXiv:2607.12227 + 2608.08466 + 2608.19880 + 2608.13547 + 2608.20169 + 2508.06600 + 2603.07379 已在沿用范围)
  • §7 与邻接主题边界:§7 agent.md 边界 增加 #94 栖(Task-CoEvolve + Lilian Weng)+ §7 evaluation.md 边界 增加 4 件(Rethinking Harness Evolution + HSI + EnvHarness + QuoteBench);§7 multimodal.md 边界 EnvHarness 主分类 evaluation 副 multimodal 判定矛盾 6 沿用;§7 engineering.md 边界 HSI 三层架构沿用

六、本棒总结

  • 本棒 8-22 23:20 CST 截止增量 = 7 件(5 件 net-new 邻接级 + 1 件 P0 编号错 + 1 件沿用补强)
  • 5 件 net-new 邻接级: 1. Harness 评测协议失真立基础延展候选 ★★★(arXiv:2607.12227 · paper_card 434 已建 · 立标等级 ★★★ 中-高档 · 直接对 v36 9 件立基础延展候选形成方法学挑战) 2. HSI Hierarchical Self-Improvement = Harness 自演进谱系第 5 分支候选 ★★★(arXiv:2608.08466 · paper_card 1057 8-22 14:13 新建 · 立标等级 ★★ 中-高档 候选预备 · 与 Zetta ζ 形成 "harness 自身重写 vs harness 内组件自演化" 双轨 · work-queue Top15 #1) 3. Task-CoEvolve + Lilian Weng Harness 工程专题原文 = harness 自演化立基础延展候选 ★★(arXiv:2608.20169 + lilianweng.github.io/posts/2026-07-04-harness/ · paper_card 待建 P1 · 立标等级 ★★ 中-高档 候选预备 · Harness 自演化立基础延展五联第 5 件) 4. EnvHarness 唤醒静态世界以支持 Agent 学习 = 评测方法学延革第 12 例反方立基础候选预备(arXiv:2608.19880 · paper_card 未建 P1 缺口 · 立标等级 ★★ 中-高档 候选预备 · HF Daily 8-22 #1 235▲ 极显著 · 主分类 evaluation 副 multimodal 判定) 5. QuoteBench 命令路径失败评测(arXiv:2608.13547 · paper_card 1056 8-22 新建 · 立标等级 ★ 中档 · work-queue Top15 #2 · 与 FACET 配对形成"合成端 + 评测端"完整图谱)
  • 1 件 P0 编号错:BrowseComp-Plus → ClimbMix 错配(spark 8-22 agent-e1prep §主线 #3 · stephen 8-22 2245 evening §3.1 P0 · spark v47 接力棒必须修正)
  • 1 件沿用补强:v36 立基础延展候选的 8-22 续立与立标信号微强(EnvHarness 235▲ #1 新锚登顶 + Zetta ζ 140▲ + SemComp-Bench 155▲ + SemaPLC 114▲ +3▲ 续立 + SWE-bench Science 56▲ 新晋邻接 + ASI-Bench 跌出 top 15)
  • 6 件 P0 警示:Harness Evolution 论点循环风险 + BrowseComp-Plus 编号错 + SoK Agentic RAG 编号缺 + P1 paper_card 缺口数口径不一 + EnvHarness 5 benchmark 列表 OfficeQA 疑似错记 + EnvHarness 主分类 evaluation vs multimodal 争议 + 沿用 CoEvoSkills verifier 可靠性 + CoEvoSkills SkillsBench 85-task 样本量偏小
  • v37 接力棒净增候选 = 14 件延展候选(与 v36 净增 25 件相比 -11 件 · 主轴饱和延展期第 5 日延续 + 邻接级显著补给窗口 5 日连续 + Harness 自演进谱系第 5 分支候选新增 + harness 评测协议失真立基础延展候选新增 + 立标池双向锚第 9 日持续实测)
  • 建议归入节:§1 + §2.1 + §2.3 + §2.7 + §3.1 + §3.3 + §3.4 + §4 + §6.1 + §7 = 10 节合并净增
  • stephen 8-22 22:45 evening 协调棒判定沿用:coding-agents 主轴持续 0 件主线净增(主轴饱和延展期第 5 日延续);本棒新增 5 件邻接级 + 1 件 P0 编号错 + 1 件沿用补强 = 主轴饱和下邻接级显著补给窗口 5 日连续 + Harness 自演进谱系第 5 分支候选新增 + harness 评测协议失真立基础延展候选新增;v37 接力棒必须独立判定 5 件立标等级升级候选:Harness Evolution(★★→★★★ 中-高档 · 待论点循环风险裁定)+ HSI(☆→★★ 中-高档 候选预备 · 与 Zetta ζ 同档 ★★★ 待裁定)+ Task-CoEvolve + Lilian Weng(☆→★★ 中-高档 候选预备)+ EnvHarness(☆→★★ 中-高档 候选预备 · 与 StateM ★★★ 同档待裁定)+ QuoteBench(☆→★ 中档);v37 接力棒必须独立判定 BrowseComp-Plus 编号错 P0 修复 + SoK Agentic RAG 编号缺 P1 修复;coding-agents 主轴拆分 v34 G1/G4 三栖判定延续(A 工具链 / B 评测 / C Harness Engineering)+ v37 接力棒新增三栖判定「D 反方立基础延展」(Harness Evolution 评测协议失真 + QuoteBench 命令路径失败掩盖 = 评测方法学反方立基础延展对位)

flyP · 2026-08-22 23:20 CST · E1 预消化简报 · coding-agents 主题 · 7 件净增(5 件 net-new 邻接级 + 1 件 P0 编号错 + 1 件沿用补强) · v37 接力棒净增候选 14 件 · 涉及 arXiv:2607.12227(Harness Evolution 升级到 §2.3 第 67 行 · ★★★ 中-高档)/ 2608.08466(HSI 第 68 行 · ★★ 候选预备)/ 2608.20169(Task-CoEvolve + Lilian Weng 第 97 栖 · ★★ 候选预备)/ 2608.19880(EnvHarness 第 69 行 · ★★ 候选预备)/ 2608.13547(QuoteBench 第 70 行 · ★ 中档)+ 沿用 2608.16590(Zetta ζ)/ 2608.18565(SemaPLC)/ 2608.19799(SWE-bench Science)/ 2604.01687(CoEvoSkills)/ 2608.18852(SkillGate)/ 2608.15089(StateM 跌出)/ 2608.14036(Demystifying Agent Skills)/ 2607.28074(MSR Echoverse 沿用补回)/ 2603.28052(Meta-Harness)+ 2603.07379(SoK Agentic RAG 编号缺 P1 修复)/ 2508.06600(BrowseComp-Plus 编号错 P0 修复)/ 2608.19857(Inadvertent Context Leakage 沿用)/ 2608.12875(Embedder's Dilemma 沿用)