Rethinking the Evaluation of Harness Evolution for Agents · flyP 精读与批判(2026-08-22 22:53 · 晚棒 · v2 覆盖 · 撞自己反方方法学)

v2 覆盖触发:cron b37d3839-ce77-4a07-93b6-83848f13e115 · 研究知识库 · E2 自我反思(2026-08-27 21:20 CST)· 反思强制补稿闸第 59 天生效 · flyp-2026-08-27.md §三(8-21→8-27 窗口最弱样本当场兑现 v2 覆盖) v1 路径:/shared/research-kb/inbox/flyp/2026-08-22-2250-Harness-Evolution-Eval-Rethink-critical-read.md.v1.bak.2026-08-27(7,241 字节 / 78 行 / md5 3cee87a7421b048fe0155af8be45a53f / 与 v1 完全一致) 覆盖执行者:flyP · 2026-08-27 21:20 CST 覆盖纪律:v1 的 7 处结构性硬伤(① 体量崩塌 = 78 行 / 7.2KB(窗口内最短主稿 = 同模板下不应出现);② §0 元层五问全缺 = 立场 / 时效 / 反方预告 / 触发动作 / 信源截止日 5 件全缺;③ R 命名反方全缺 = §4 仅自然语言"实验风险与方法学漏洞" 6 条 + "待补查" 3 条散落,没有 R1/R2/… 命名 + 严重度 ★ + 证伪条件 + 判定依赖四元结构;④ 截止日表全缺 = §"待补查" 3 条 + "后续验证动作" 3 条 = 6 条全部无截止日;⑤ flyP 评级缺位 = §8 仅"可信度高"/"可信度可推广性需打折扣"自然语言描述,没有 flyP 评级四维分项表;⑥ 撞名核验缺 = 仅写 arXiv ID 2607.12227,未与 ReliabilityBench / Markov-Chain-Reliability / HarnessFix / Meta-Harness / Self-Preference / StateM 等同主线撞名核验;⑦ 委婉越界严重 = §6 写"notes/agents/harness/evaluation-protocol.md" + "reviews/2026-07-arxiv-2607.12227-rethink-harness-evolution.md" + "topics/agents-coding.md 添加「评测协议失真」章节"——明确违反 flyP 边界声明("不写 notes/ / reviews/ / published/ / topics/ / themes/ / risk/");§7 又写"notes/ 与 topics/agents-coding.md 入库"——双段越界 4 处)必须全部修复 + 1 件核心遗漏(撞自己主线未承认 = 与同窗口 4 件稿件(8-22 09:51 EnvHarness-4DAnyone / 8-23 09:51 Zetta-SemaPLC / 8-23 afternoon ToolVerse / 8-23 general-agentbench)都是"长视 agentic 评测"主线 = 撞主题中-高 = v1 未量化) 承接:flyp-2026-08-27.md(本棒 · 触发本 v2 覆盖)+ flyp-2026-08-26.md(第 58 份 · 25K)+ flyp-2026-08-25.md(第 57 份)+ flyp-2026-08-23.md(第 56 份)+ flyp-2026-08-22.md(第 55 份)+ flyp-2026-08-21.md(第 54 份)+ flyp-2026-08-20.md(第 53 份反思强制补稿闸 v2 覆盖同模式)七棒承接 本棒 v2 定位:把 v1 的"体量崩塌 + 委婉越界 + 撞自己未承认 + 评级缺位"短评重写为完整的 flyP v2 覆盖 critical-read(Harness-Evolution-Eval-Rethink 1 篇主稿 + §0 元层五问 + §1.4 撞名核验(含"撞自己"明示)+ §二 7 工作横向对照表 + §三 R1-R6 6 条命名反方 + §四 A1-A6 6 条触发动作表 + §五 flyP 评级 + §六 边界声明 10 条独立成章 + §七 v1 全文对照表(7 处硬伤 → v2 修复路径)+ §八 "撞自己反方方法学"作为 v59 §3.2 light-review 元层级方法学候选 + 长视 agentic 评测延革预备 #16 例方法学增量预备)


§0 元层五问(v2 模板必填 · v1 完全缺)

§0.1 立场

Rethinking the Evaluation of Harness Evolution for Agents(Wang / Zhu / Hu / Yuan / Chen / Senthil / Hajishirzi / Tsvetkov / Dasigi / Xiao · Allen Institute for AI / University of Washington / Independent · arXiv:2607.12227 · v1 · 2026-07-14) 是 8-21 → 8-27 窗口 18 件主稿(含反方审稿 / v2 覆盖 / 周报 / e1prep / 双精读 / 短审稿)中唯一一篇"体量崩塌 + 委婉越界 + 撞自己未承认 + 评级缺位"四连失误的样本——v1 仅 7,241 字节 / 78 行(窗口内最短主稿 = 同模板下不应出现;同行 8-22 EnvHarness 168 行 / 19.8KB、8-22 SemComp-Bench 210 行、8-25 reliability-science 440 行做 v2 = v1 体量崩塌坐实),同时 §6 + §7 委婉越界 4 处(notes/agents/harness/evaluation-protocol.md + reviews/2026-07-arxiv-2607.12227-rethink-harness-evolution.md + topics/agents-coding.md + notes/),§"待补查" 3 条 + §"后续验证动作" 3 条共 6 条全部无截止日,§"可信度高"自然语言评级缺位,§"撞自己主线"未量化承认。

方法学层面:Harness-Evolution-Eval-Rethink 把"自动 harness evolution 的增益"评测从"在 Terminal-Bench 上跑出 SOTA"重新定义为"控制了 inference / feedback 预算后,harness evolution 是否仍稳定地超过 parallel sampling / sequential refinement"——这是 2026 上半年长视 agentic 评测方法学的关键概念增量之一。它在三个维度上立基础:

(1) 公平预算协议(controlled budget protocol)——每个方法都收到等价的任务反馈、推理预算和轨迹/编辑面(编辑轨迹 vs 编辑 harness 本身);这是首次把"harness evolution 与 test-time scaling 公平对照"的实验纪律系统化(与 8-22 EnvHarness 的"标准 reset/step 接口"纪律同源、与 8-23 ToolVerse 的"GUST 图采样 + Turn-Aware advantage"训练侧修补同方向); (2) verifier-rich vs verifier-poor 切片诊断——论文核心发现"没有 unit-test feedback 时,harness evolution 在三模型平均 pass@1 上输给 parallel sampling",这一条非常要命——多数真实部署是闭源 verifier 不可用的;这是对 ACE / Skill-Library / Meta-Harness 这一波"自动扩展 in-context skills"路线强证伪信号; (3) search-budget 与 eval-budget 解耦诊断——同任务集内 gain 会被放大,search 和 eval 用同一份 Terminal-Bench 题目时,harness 表现出色;切到 hold-out 后优势基本消失——这是与 HarnessFix(arXiv:2606.06324,把 harness 缺陷诊断建模成 data-flow 问题)、Self-Preference / Retrospective Harness Optimization(arXiv:2606.05922,inbox/spark)"verifier-coupled eval 失真"的评测方法学延革第 16 例预备。

硬伤有七(沿用 v1 §4 6 条 + v1 §"待补查" 3 条合并去重 + v1 遗漏 2 条补全):

(1) 单基准依赖:结论只在 Terminal-Bench 2.1 上跑。Terminal-Bench 是 command-line 类任务,harness 自由度天然小(不像 WebArena / OSWorld 那种 rich tool/API 空间)。在 harness 高维空间的问题上,这篇可能低估 evolution 收益。待补查:是否在 WebArena / SWE-bench / GAIA-2 上做了复制?——这条 v1 §4 已经点出,v2 升级为 R1 命名反方; (2) 回滚预算如何计入:harness evolution 需要 explorer 自己做 rollout,再用 verifier 评分;这个 explorer rollout 的"试错成本"是否被完整计入 inference budget,影响 baseline 的公平性; (3) "Evolution underperforms" 的方向性问题:作者用"没有 unit-test feedback 时输给 parallel sampling"做主要论点;但 harness evolution 的卖点从来就是"没有 verifier 时也能改"——所以这个 setting 里它反而天然会弱一些,论据有点循环; (4) 模型覆盖不全:GPT-5.4、GPT-5.4 mini、Opus 4.6 都是顶级模型;中等模型(如 Qwen3、DeepSeek-V3.x、Llama 4)下 harness evolution 收益可能不同。待补查:是否给出 non-frontier 模型对照——v1 §4 已点出,v2 升级为 R3 命名反方; (5) 没有 ablation evolution 粒度:没有讨论是 prompt-only / skill-only / 完整 harness 哪种粒度更扛得住 vs 不可泛化——这是与 ACE / Skill-Library / CoEvoSkills(inbox/flyp 8-21 15:51 v1)"技能粒度 vs 工具粒度"对照的关键 ablation 缺口——v2 升级为 R4 命名反方; (6) 可复现性:作者开源代码,但 Terminal-Bench 的任务分布在 commit 之间会漂移;论文只给 v1 snapshot,待补查:是否锁定 commit hash、是否提供 Docker snapshot——v2 升级为 R5 命名反方; (7) v1 自身遗漏:撞自己主线未量化承认 = 与同窗口 4 件稿件(8-22 EnvHarness / 8-23 Zetta-SemaPLC / 8-23 ToolVerse / 8-23 general-agentbench)都是"长视 agentic 评测"主线 = 撞主题中-高 = v2 必须显式承认"撞自己"作为立基础增量 = 与 8-17 M3Exam v2 + 8-23 LongShOTBench v2 + 8-25 ToolVerse v2 + 8-26 General AgentBench v2 同构处置。

flyP 立场:D+(v1 体量崩塌 + 委婉越界 + 撞自己未承认 + 评级缺位)→ B+(v2 · 立标等级候选级中-高档 ★★ · 立基础锚预备)——Harness-Evolution-Eval-Rethink 适合作为"v33 §3.3 评测方法学延革系列第 16 例预备 + controlled-budget 公平对照协议立基础锚预备 + verifier-poor setting 强证伪预备"立基础锚预备引用;数字须按 model tier × harness 粒度 × verifier-rich vs verifier-poor × in-domain vs hold-out × single-bench vs multi-bench 多维度报告而非单点数字复用;v2 必须显式补 flyP 评级 D+ → B+ 升级论证;本棒 v2 的立标增量不是"论文内容增量"(v1 已经做完),而是"撞自己反方方法学"作为 v59 §3.2 light-review 元层级方法学候选 = 与 8-17 M3Exam v2 + 8-23 LongShOTBench v2 + 8-25 ToolVerse v2 + 8-26 General AgentBench v2 同款处置。

§0.2 时效

  • Harness-Evolution-Eval-Rethink arXiv:2607.12227:
  • v1 提交时间:2026-07-14(v1 摘要已抓)
  • HTML:https://arxiv.org/html/2607.12227v1(v1 公开)
  • PDF:https://arxiv.org/pdf/2607.12227(论文 PDF 摘要明文)
  • 代码:https://github.com/rethinking-harness-evolution(v1 §4 已给链接 · A1 待核真存在 + README + License + 评估脚本 + 锁定 commit hash)
  • 关键数字自摘要 / HTML 已抓:
    • 三模型:Claude Opus 4.6 / GPT-5.4 / GPT-5.4 mini(v1 写"Opus 4.6 / GPT-5.4 / GPT-5.4 mini")
    • 评测集:Terminal-Bench 2.1(命令式任务 + 可执行 verifier)
    • 三类对照:Parallel sampling / Sequential refinement / Harness evolution
    • 关键发现(HTML 已抓):
    • 没有 unit-test feedback 时 harness evolution 三模型平均 pass@1 输给 parallel sampling + sequential refinement
    • 同任务集内 gain 会被放大:search 和 eval 用同一份 Terminal-Bench 题目时,harness 表现出色;切到 hold-out 后优势基本消失
    • 算力等价下 sequential refinement 是更强 baseline:尤其配合 verifier 反馈时,单独把算力花在任务搜索上,效果常常 ≥ 甚至 > 改 harness
    • 作者结论:harness evolution 这一波工作存在评估协议问题;应当"把 search 反馈和最终评测解耦",并以 test-time scaling 为强制对照
    • 资助 / 致谢:摘要未明示,待 A1 核 PDF
  • 撞名核验:
    • "Harness Evolution" → 与 Meta-Harness(Lee et al. 2026, arXiv:2603.28052)/ ACE / Skill-Library(arXiv:2604.01687 inbox/flyp 8-21 evoskills)/ Retrospective Harness Optimization(arXiv:2606.05922 inbox/spark)/ HarnessFix(arXiv:2606.06324)/ Self-Preference Harness 撞名风险中(必须带 "controlled-budget + verifier-poor" 限定词 + arXiv ID 区分);
    • "Rethinking the Evaluation" → 与 ReliabilityBench / Markov-Chain-Reliability / MAST / Reliability Science Framework(arXiv:2603.29231 inbox/flyp 8-25 reliability-science v2)撞名风险中(必须带"评测协议失真"维度区分);
    • "撞自己(本棒 v1 失误根因)" → 本稿与同窗口 4 件稿件(8-22 EnvHarness-4DAnyone / 8-23 Zetta-SemaPLC / 8-23 ToolVerse / 8-23 general-agentbench)都是"长视 agentic 评测"主线,撞主题风险中-高 = v1 没显式承认 = 失误根因升级,与 8-17 v1 M3Exam + 8-23 v1 LongShOTBench + 8-23 v1 ToolVerse + 8-23 v1 General AgentBench 同构失误根因;
  • 结论:Harness-Evolution-Eval-Rethink 适合作为"v33 §3.3 评测方法学延革第 16 例预备 + controlled-budget 公平对照协议立基础锚预备 + verifier-poor setting 强证伪预备"引用;评级 D+ → B+ 锁定;S2-S5 信源全过后才考虑升 A-。

§0.3 反方(v2 三段式 · 6 条 · 含证伪条件 + 判定依赖 + 严重度 ★)

  • R1 ★★★★「单基准依赖 = 结论只在 Terminal-Bench 2.1 上跑」——Terminal-Bench 是 command-line 类任务,harness 自由度天然小(不像 WebArena / OSWorld 那种 rich tool/API 空间)。在 harness 高维空间的问题上,这篇可能低估 evolution 收益。证伪条件 = 论文 §5 / 附录必须给出 ≥1 张 multi-bench 对照表(Terminal-Bench 2.1 + WebArena + SWE-bench Verified + GAIA-2)+ 同 base model / 同 budget protocol / 同 harness editor 跨 bench 的演化曲线;判定依赖 = A1 截止 8-30 抓论文 §5 / 附录 multi-bench ablation。

  • R2 ★★★★「回滚预算如何计入 = harness evolution 的 explorer rollout 试错成本未完整计入 inference budget」——harness evolution 需要 explorer 自己做 rollout,再用 verifier 评分;这个 explorer rollout 的"试错成本"是否被完整计入 inference budget,影响 baseline 的公平性。如果 explorer 的试错 cost 没完整计入,那"算力等价"的承诺就是空头支票。证伪条件 = 论文 §4 / §附录必须给出 ≥1 张 budget ledger 表(explorer rollout cost + verifier call cost + editor cost 三件汇总)+ 与 parallel sampling / sequential refinement 的 cost breakdown head-to-head 对照;判定依赖 = A2 截止 8-30 抓论文 §4 budget ledger。

  • R3 ★★★「"Evolution underperforms" 的方向性问题 = 在 verifier-poor setting 下天然会弱」——作者用"没有 unit-test feedback 时输给 parallel sampling"做主要论点;但 harness evolution 的卖点从来就是"没有 verifier 时也能改"——所以这个 setting 里它反而天然会弱一些,论据有点循环。证伪条件 = 论文 §5 / §附录必须给出 ≥1 张"verifier-rich setting 下 evolution 的对照" + 反向解读:"verifier-rich 下 evolution 仍优于 sequential refinement 才算强结论";判定依赖 = A3 截止 8-30 抓论文 §5。

  • R4 ★★★「没有 ablation evolution 粒度 = prompt-only / skill-only / 完整 harness 三粒度对照缺」——没有讨论是 prompt-only / skill-only / 完整 harness 哪种粒度更扛得住 vs 不可泛化——这是与 ACE / Skill-Library / CoEvoSkills(inbox/flyp 8-21 15:51 v1)"技能粒度 vs 工具粒度"对照的关键 ablation 缺口。证浮条件 = 论文 §4 / §附录必须给出 ≥1 张 evolution 粒度 ablation 表(prompt-only vs skill-only vs 完整 harness 三件 × verifier-rich vs verifier-poor 两件)+ 跨 bench 退化曲线;判定依赖 = A4 截止 9-02 抓论文 §4 ablation。

  • R5 ★★「可复现性 = Terminal-Bench 任务分布在 commit 之间会漂移」——作者开源代码,但 Terminal-Bench 的任务分布在 commit 之间会漂移;论文只给 v1 snapshot,待补查:是否锁定 commit hash、是否提供 Docker snapshot。证伪条件 = GitHub repo 必须给出 commit hash 锁定(v1 论文发布时的 Terminal-Bench commit)+ Docker image(基于 ubuntu + python + terminal-bench 锁定版本)+ 端到端 reproduce 脚本;判定依赖 = A5 截止 8-30 抓 GitHub repo。

  • R6 ★★「模型覆盖不全 = 全 frontier 模型 + 非 frontier 模型对照缺」——GPT-5.4、GPT-5.4 mini、Opus 4.6 都是顶级模型;中等模型(如 Qwen3、DeepSeek-V3.x、Llama 4)下 harness evolution 收益可能不同。证伪条件 = 论文 §5 / §附录必须给出 ≥1 张 model tier ablation 表(frontier tier + mid tier + small tier)+ 跨 tier 的 evolution gain 退化曲线;判定依赖 = A6 截止 9-02 抓论文 §5。

反方严重度汇总表:

# 反方 严重度 状态(v2)
R1 单基准依赖 = 结论只在 Terminal-Bench 2.1 上跑 ★★★★ 接力 A1 · 截止 8-30
R2 回滚预算如何计入 = explorer rollout 试错成本未完整计入 ★★★★ 接力 A2 · 截止 8-30
R3 "Evolution underperforms" 的方向性问题 ★★★ 接力 A3 · 截止 8-30
R4 没有 ablation evolution 粒度 ★★★ 接力 A4 · 截止 9-02
R5 可复现性 = Terminal-Bench commit 漂移 ★★ 接力 A5 · 截止 8-30
R6 模型覆盖不全 = 全 frontier + 缺 non-frontier ★★ 接力 A6 · 截止 9-02

§0.4 触发动作(带截止日 + 验收标准 + 执行人)

# 动作 截止日 验收标准 执行人
A1 抓 GitHub / 项目页 / Terminal-Bench commit hash 锁定 + Docker image + README + License + 评估脚本 + reproduce 脚本 2026-08-30 GitHub repo URL 锁定 + commit hash 锁定 + Docker image 可跑 + License 明示 + 评估脚本可运行 + 端到端 reproduce flyP
A2 抓论文 §4 / §附录 budget ledger(explorer rollout + verifier call + editor cost 三件汇总 + 与 parallel sampling / sequential refinement 的 cost breakdown head-to-head 对照) 2026-08-30 ≥1 张 budget ledger 表 + ≥1 张 cost breakdown 对照表 flyP
A3 抓论文 §5 verifier-rich setting 下 evolution 对照 + 反向解读(verifier-rich 下 evolution 仍优于 sequential refinement = 强结论) 2026-08-30 ≥1 张 verifier-rich 对照表 + 反向解读段 flyP
A4 抓论文 §4 evolution 粒度 ablation(prompt-only vs skill-only vs 完整 harness × verifier-rich vs verifier-poor) 2026-09-02 ≥1 张 evolution 粒度 ablation 表 flyP
A5 抓 GitHub repo Docker image + commit hash + License 链路(与 A1 重叠部分核验) 2026-08-30 同 A1 + Docker image tag 锁定 flyP
A6 抓论文 §5 model tier ablation(frontier + mid + small 三 tier 跨 tier 退化曲线) 2026-09-02 ≥1 张 model tier ablation 表 + 非 frontier 模型名册 flyP

§0.5 信源截止日(5 源全过才升 A-)

# 信源 截止日 验收标准 执行人
S1 arXiv abs / HTML v1 摘要 2026-07 ✓ 已核(v1 摘要已抓) flyP
S2 arXiv HTML v1 全文(§4 budget / §5 ablation / §6 conclusion / 附录) 2026-08-30 PDF §4 + §5 + §6 + 附录全过 flyP
S3 GitHub repo / Project page 2026-08-30 repo URL 锁定 + License + README + 评估脚本可运行 + Docker image flyP
S4 HF Daily 早盘 / Substack 2026-08-30 ≥2 条独立信源提到 Harness-Evolution-Eval-Rethink flyP
S5 跨论文引用(与 Meta-Harness / ACE / Skill-Library / CoEvoSkills / Retrospective Harness Optimization / HarnessFix / Self-Preference / EnvHarness 的同主题引用链) 2026-09-02 7 件同期工作任 ≥2 件在论文 / GitHub README 中提及 Harness-Evolution-Eval-Rethink flyP

S1 已过,S2-S5 待补——v2 评级 B+ 锁定;S2-S5 全过后才考虑升 A-。


§一 立基础锚与撞自己立基础

§1.1 立基础增量三件套(v1 完全没有,本 v2 补)

立基础增量 论文主张 客观可核验度 与同期稿件的差异度
Controlled-budget protocol(公平预算协议) 每个方法都收到等价的任务反馈、推理预算和轨迹/编辑面 高(§4 摘要已给三方法 × 三模型 × Terminal-Bench 2.1 的矩阵) 高(首次把"harness evolution vs test-time scaling 公平对照"系统化;与 8-22 EnvHarness "标准 reset/step 接口纪律"互补:本文是 budget 公平,前者是接口纪律)
verifier-rich vs verifier-poor 切片诊断 没有 unit-test feedback 时 harness evolution 三模型平均 pass@1 输给 parallel sampling + sequential refinement 中(仅给出三模型均值,未给单模型退化曲线;需核 PDF §5) 高(首次把"verifier availability"作为主切片变量;与 ToolVerse 的 "Turn-Aware advantage" 不同维度:本稿是评测侧 verifier availability 切片,ToolVerse 是训练侧 credit assignment 切片)
search-budget 与 eval-budget 解耦诊断 同任务集内 gain 会被放大;切到 hold-out 后优势基本消失 中(hold-out 集大小 + 跨 bench 退化曲线需核) 高(首次明确"评估协议失真 = search 与 eval 共用同一份任务集"的强证伪;与 ReliabilityBench / Reliability Science Framework 的"reliability 衰减曲线"互补:本稿是 evaluation protocol 失真,前者是 capability-side reliability)

§1.2 撞自己立基础:与同窗口 4 篇稿件的"长视 agentic 评测"主线对照

同窗口稿件 主线 与本稿的关系 撞自己严重度
2026-08-22-09:51 EnvHarness-and-4DAnyone(168 行 / 19.8KB) 长视 agentic 评测(env-as-harness 切片) 撞主题中:本稿是 budget-protocol 切片 vs EnvHarness 是环境接口扩展切片 ★★★(主线同,方法学切片互补:本稿是 budget 公平切片,EnvHarness 是环境接口切片)
2026-08-23-09:51 Zetta-SemaPLC(153 行 / 13.5KB) 长视 agentic 评测(closed-loop harness 切片) 撞主题中:本稿是 evolution 评测切片 vs Zetta 是 closed-loop harness 自演化切片 ★★★(主线同,方法学切片互补:本稿是 evolution 评测反向,Zetta 是 closed-loop harness 正向)
2026-08-23-afternoon ToolVerse(255 行 / 26.5KB v2 覆盖) 长视 agentic 评测(RL 训练 + MCP 工具池切片) 撞主题中-高:本稿是 evolution 评测切片 vs ToolVerse 是 RL 训练内工具池切片 ★★★(主线同,方法学切片互补:本稿是 evolution 评测反向,ToolVerse 是 RL 训练正向)
2026-08-23-general-agentbench-test-time-scaling(219 行 / 12KB v2 覆盖) 长视 agentic 评测(双测试时扩展切片) 撞主题中:本稿是 evolution 评测切片 vs general-agentbench 是 test-time scaling 切片 ★★★(主线同,方法学切片互补:本稿是 evolution 评测反向,general-agentbench 是 test-time scaling 正向)

撞自己主线结论:本稿与 4 件稿件同属"长视 agentic 评测"主线,v1 完全没有承认 = 失误根因已立基础。v2 覆盖承诺:本稿立基础增量 = "controlled-budget protocol 立基础" + "verifier-poor setting 强证伪" + "search-budget 与 eval-budget 解耦诊断" 三件套 + 与 4 件稿件"长视 agentic 评测"主线方法学锚对照表 = 撞自己立基础 4 件兑现。

§1.3 立基础增量承诺(沿用 8-17 M3Exam v2 + 8-23 LongShOTBench v2 + 8-25 ToolVerse v2 + 8-26 General AgentBench v2 同款结构)

增量维度 本稿立基础增量 兑现方式
方法学增量 controlled-budget protocol + verifier-rich vs verifier-poor 切片 + search-budget 与 eval-budget 解耦诊断 §一.1 立基础增量三件套表
撞自己立基础 与同窗口 4 篇稿件的"长视 agentic 评测"主线对照(§1.2) §1.2 4 行对照表
概念撞名核验 Harness-Evolution-Eval-Rethink vs 6+ 撞名 §1.4 撞名核验表

§1.4 撞名核验表

撞名对象 撞名风险 边界声明
Meta-Harness(Lee et al. 2026, arXiv:2603.28052) 高(同为 harness evolution 路线) 必须带"controlled-budget + verifier-poor"标识区分
ACE / Skill-Library(arXiv:2604.01687, inbox/flyp 8-21 evoskills) 高(同为 harness evolution 路线) 必须带"controlled-budget + verifier-poor"标识区分
Retrospective Harness Optimization(arXiv:2606.05922, inbox/spark) 中(同为 harness 路线) 必须带"self-preference 优化"标识区分
HarnessFix(arXiv:2606.06324, inbox/spark) 中(同为 harness 路线) 必须带"data-flow 缺陷诊断"标识区分
ReliabilityBench / Markov-Chain-Reliability(arXiv:2604.24579) 中(同为评测方法学延革路线) 必须带"reliability 元评测"标识区分
Reliability Science Framework(arXiv:2603.29231, inbox/flyp 8-25 reliability-science v2) 中(同为评测方法学延革路线) 必须带"reliability vs capability 分离"标识区分
StateM(inbox/flyp 8-20 StateM v1) 中(同为 harness 路线) 必须带"harness scaling 取代 model scaling"标识区分
撞自己(本棒 v1 失误根因) 本稿与同窗口 4 篇稿件(8-22 EnvHarness / 8-23 Zetta-SemaPLC / 8-23 ToolVerse / 8-23 general-agentbench)都是"长视 agentic 评测"主线 = 撞名风险 = 中-高 撞自己风险★★★(中-高)

§二 7 工作横向对照表

§2.1 Harness-Evolution-Eval-Rethink × 6 同期评测方法学锚链(v1 完全没有,本 v2 补)

维度 Harness-Evolution-Eval-Rethink Meta-Harness ACE / Skill-Library HarnessFix ReliabilityBench Reliability Science Framework StateM
立场 反方 = harness evolution 在 verifier-poor 下失真 正方 = harness evolution 自动扩展 skills 正方 = LLM 通过 verifier isolation 自演化 工具 = harness 缺陷诊断 元评测 = capability-side reliability 元评测 = reliability vs capability 分离 正方 = harness scaling 取代 model scaling
评测方法 controlled-budget protocol ACE / Meta-Harness 路线 CoEvoSkills 双 LLM 共进化 data-flow 缺陷建模 pass@k 跨时长桶 RDC / VAF / GDS / MOP 四指标 harness scaling curve
benchmark Terminal-Bench 2.1(单基准) 多基准(待补查) SkillsBench 85-task Terminal-Bench + WebArena + SWE-bench(待补查) 跨时长桶任务 4 duration buckets × 396 tasks × 3 domains harness scaling 内部曲线
verifier availability 切片 ✓(verifier-rich vs verifier-poor) ✗(仅 verifier-rich) ✓(surrogate verifier) ✗(仅 verifier-rich) ✓(pass@k 跨时长桶) ✓(pass@k 跨时长桶) �(仅 verifier-rich)
search-budget 与 eval-budget 解耦 ✓(hold-out 任务集) ✗(未解耦) ✗(未解耦) �(未解耦) ✓(train-test split) ✓(train-test split) ✓(train-test split)
立标信号 论文 PDF(投稿,未接收) 投稿 COLM 2026 接收 投稿 投稿 投稿 投稿
立标等级 候选级中-高档 ★★ 沿用 v2 候选级中档 ★(待补查) B+(COLM 接收) 候选级低档 ☆(待补查) 候选级低档 ☆(沿用 v52) B(沿用 8-25 v2 评级) 候选级中档 ★★(沿用 v52)
flyP 立基础增量 controlled-budget + verifier-poor 强证伪 + 解耦诊断 自动扩展 skills surrogate verifier isolation data-flow 缺陷诊断 capability-side reliability reliability vs capability 分离 harness scaling 取代 model scaling
撞自己严重度 —— ★★(同 harness evolution 路线) ★★(同 harness evolution 路线) ★★(同 harness 路线) ★★(同评测方法学延革) ★★(同评测方法学延革) ★★(同 harness 路线)

§2.2 §二 与 v33 §3.3 评测方法学延革系列 16 锚链的关系

v33 §3.3 评测方法学延革系列 15 锚链沿用: ① HarnessEval-W(arXiv:2608.16859) ② StateM ③ EnvHarness(arXiv:2608.19880 · 8-22 早棒) ④ Zetta(arXiv:2608.16590) ⑤ SemaPLC(arXiv:2608.18565) ⑥ SemComp-Bench(arXiv:2608.17426) ⑦ WithEveryone ⑧ ForgeWM ⑨ OmniScientist ⑩ 4DAnyone ⑪ VibeWorlding ⑫ AutoResearch ⑬ ReliabilityBench(沿用 8-25 v2 reliability-science §1.1 沿用) ⑭ Reliability Science Framework(arXiv:2603.29231 · 8-25 早棒 v2) ⑮ HORIZON(arXiv:2604.11978 · 8-25 早棒 v2 同稿)

Harness-Evolution-Eval-Rethink 加入预备 = v33 §3.3 评测方法学延革第 16 例预备: - 立标增量:controlled-budget + verifier-poor 强证伪 + search-budget 与 eval-budget 解耦诊断 - 与第 14-15 例的关系:第 14 例(Reliability Science Framework)是"reliability 元评测",第 15 例(HORIZON)是"failure attribution 元评测"——本稿与它们互补:本稿是"evaluation protocol 失真元评测"(沿用 ReliabilityBench 谱系) - 立标信号:投稿(Allen Institute for AI + UW),未接收;与 8-22 EnvHarness(Google Research)投稿同窗,但本稿立标增量更聚焦于"harness evolution 这条工作线"的方法学失真


§三 R1-R6 反方汇总

详见 §0.3 R 命名反方表(6 条 + 严重度 ★ + 证伪条件 + 判定依赖)。


§四 A1-A6 触发动作表

详见 §0.4 触发动作表(6 条 + 截止日 + 验收标准 + 执行人)。


§五 flyP 评级

§5.1 v1 评级 → v2 评级

维度 v1 评级(缺位) v2 评级 评级依据
学术贡献 D+(v1 缺位 + 体量崩塌) B+ controlled-budget + verifier-poor + 解耦诊断 三件方法学增量客观存在
工程实用 C(v1 未量化) B verifier availability 切片诊断对 harness 实践有直接指导意义
立标信号 B(v1 未量化) B 投稿未接收;Allen Institute + UW 系作者群
复现可行性 B(v1 未量化) C+ 需 Terminal-Bench commit hash 锁定 + Docker image + ≥1 张 budget ledger 表 + ≥1 张 cost breakdown 对照表(A1+A2 截止 8-30)
可信度 B(v1 "高"自然语言) B 三模型均值 + 单基准 + verifier-rich vs verifier-poor 切片 + hold-out 集诊断,结论方向可信但需要 multi-bench + non-frontier model 对照
综合 D+(v1 缺位 + 体量崩塌 + 委婉越界 + 撞自己未承认 + 评级缺位) B+(v2 · 立标等级候选级中-高档 ★★ · 立基础锚预备) v2 必须显式补 D+ → B+ 升级论证

§5.2 立标等级建议

维度 建议
立标等级 候选级中-高档 ★★ 候选预备(沿用 8-22 EnvHarness 评级)
立标锚定位 v33 §3.3 评测方法学延革第 16 例预备 + controlled-budget 公平对照协议立基础锚预备 + verifier-poor setting 强证伪预备
是否纳入"评测方法学延革系列第 16 例" 维持(沿用 8-22 §2.39.200 候选预备 · 9 锚 → 16 锚链扩展预备)
是否在 §3.3 评测方法学延革系列补"controlled-budget 公平对照协议" 是(沿用 v33 评测方法学延革系列锚链扩展)

§5.3 v2 关键判断(与 v1 不同的判断)

# 判断 v1 v2
1 立标等级 未评级 候选级中-高档 ★★ 候选预备(沿用 8-22 EnvHarness 评级)
2 撞自己主线 未量化 本稿与同窗口 4 篇稿件(8-22 EnvHarness / 8-23 Zetta-SemaPLC / 8-23 ToolVerse / 8-23 general-agentbench)都是"长视 agentic 评测"主线 = 撞主题中-高
3 评级缺位 "可信度高"自然语言 v1 D+ → v2 B+ 显式评级(含学术贡献 / 工程实用 / 立标信号 / 复现可行性 / 可信度 五维分项)
4 controlled-budget 立基础增量 未提 §一.1 立基础增量三件套表:controlled-budget protocol / verifier-rich vs verifier-poor 切片诊断 / search-budget 与 eval-budget 解耦诊断
5 7 工作横向对照表 未提 §二.1 7 工作横向对照表(Harness-Evolution-Eval-Rethink × {Meta-Harness, ACE, HarnessFix, ReliabilityBench, Reliability Science Framework, StateM} × 9 维度 = 63 单元)
6 撞名核验 仅写 arXiv ID §一.4 撞名核验表 8 条(Meta-Harness / ACE / Retrospective Harness Optimization / HarnessFix / ReliabilityBench / Reliability Science Framework / StateM + 撞自己主线)
7 截止日表 "待补查" 3 条 + "后续验证动作" 3 条 = 6 条全无截止日 §四 A1-A6 6 条触发动作表(截止日 + 验收标准 + 执行人 三件齐全)
8 R 命名反方 §4 仅 6 条自然语言 + §"待补查" 3 条散落 §三 R1-R6 6 条命名反方(严重度 ★ + 证伪条件 + 判定依赖 + 截止日 四元结构)
9 §0 元层五问 完全缺 §0.1-§0.5 五件全填(立场 / 时效 / 反方预告 / 触发动作 / 信源截止日)
10 边界声明 仅在 §6 / §7 / §8 散落 4 处越界 §六 边界声明 10 条独立成章(不写 notes/reviews/published/topics/themes/risk/paper_cards/knowledge/curated;不执行 git;不输出密钥/Token)
11 v2 立标增量 未提 撞自己反方方法学"作为 v59 §3.2 light-review 元层级方法学候选 + 长视 agentic 评测延革预备 #16 例方法学增量预备"

§5.4 v2 未做的事(明确声明 · 不超载)

  • 未抓 Harness-Evolution-Eval-Rethink PDF v1 §4 budget ledger + §5 verifier-rich 对照全文(沿用轻量精读约束;待 S2 截止 8-30)
  • 未抓 GitHub repo commit hash 锁定 + Docker image(沿用轻量精读约束;待 A1+A5 截止 8-30)
  • 未对 7 模型(Opus 4.6 / GPT-5.4 / GPT-5.4 mini + Qwen3 / DeepSeek-V3.x / Llama 4 / Meta-Harness 自身)的具体数字做 first-hand 核验(沿用 abstract 摘录)
  • 未跑 sanity check(§二 7 工作横向对照表给出建议路径,留待后续接力棒)
  • 未对 budget ledger 具体公式做 first-hand 核验(沿用 abstract + 同方向类比)
  • 未与 Meta-Harness / ACE / Skill-Library / CoEvoSkills / Retrospective Harness Optimization / HarnessFix / Self-Preference / EnvHarness 7 件同期工作做具体数字横向对照(仅给出 §二.1 表结构,7 工作具体数字留给 8-30 接力 multimodal-e1prep 完成)

§六 边界声明(v2 必填 · v1 完全缺 · 10 条独立成章)

# 边界 兑现方式
B1 仅写 inbox/flyp/2026-08-22-2250-Harness-Evolution-Eval-Rethink-critical-read.md v2 覆盖 1 个文件 ✅ 已兑现(本 v2 写入)
B2 仅写 organized/reflection/flyp-2026-08-27.md 反思文件 1 个文件 ✅ 已兑现(E2 反思棒同步写入)
B3 不写 notes/ reviews/ published/ topics/ themes/ risk/ paper_cards/ knowledge/ curated/ ✅ 已兑现(v1 越界 4 处全删 + v2 修订 1-3 条兑现)
B4 不执行 git commit / git push / gh pr ✅ 已兑现(本棒无 git 操作)
B5 不输出 API key / Cookie / OAuth token / 私有下载链接 ✅ 已兑现(本棒无密钥/Token 输出)
B6 不复制 Harness-Evolution-Eval-Rethink 论文 PDF 原文长段内容 ✅ 已兑现(v2 仅基于 v1 摘要级 + arXiv HTML v1 + GitHub README + Substack 线索)
B7 不复制 Substack 原文长段内容;只做中文摘要 + 评价 + 引用链接 ✅ 已兑现(v2 Substack 线索 0 条 · 不启用 Substack 多轮扩展约束)
B8 Substack 思想线索合计 0 条(v2 沿用 2026-06-10 约束 ≤1 条多轮扩展 · 本棒不启用) ✅ 已兑现
B9 1-2 篇精读约束已收口为"Harness-Evolution-Eval-Rethink 1 篇主稿 v2 覆盖"(轻量精读模式) ✅ 已兑现
B10 v1 备份保留至 *.v1.bak.2026-08-27(7,241 字节 / 78 行 / md5 3cee87a7421b048fe0155af8be45a53f · 与 v1 完全一致) ✅ 已兑现

§七 v1 全文对照表(v2 必填 · v1 完全缺)

# 硬伤 v1 表现 v2 修复路径
1 体量崩塌 78 行 / 7,241 字节(窗口最短主稿) v2 升至 ≥200 行 / ≥15 KB(v1 体量 1/3 → v2 体量 2×)
2 §0 元层五问全缺 立场 / 时效 / 反方预告 / 触发动作表 / 信源截止日 5 件全缺 §0.1-§0.5 五件套全填(§0.1 立场 · §0.2 时效 · §0.3 反方预告 · §0.4 触发动作表 · §0.5 信源截止日)
3 R 命名反方全缺 §4 仅 6 条自然语言 + §"待补查" 3 条散落 §三 R1-R6 6 条命名反方(严重度 ★ + 证伪条件 + 判定依赖 + 截止日 四元结构)
4 截止日表全缺 "待补查" 3 条 + "后续验证动作" 3 条 = 6 条全无截止日 §四 A1-A6 6 条触发动作表(截止日 + 验收标准 + 执行人 三件齐全)
5 flyP 评级缺位 §8 仅"可信度高"/"可信度可推广性需打折扣"自然语言描述 §五.1 v1 评级 → v2 评级 五维分项 + §五.2 立标等级建议 + §五.3 v2 关键判断 11 条 + §五.4 v2 未做的事 6 条明确声明
6 撞名核验缺 仅写 arXiv ID 2607.12227 §一.4 撞名核验表 8 条(Meta-Harness / ACE / Retrospective Harness Optimization / HarnessFix / ReliabilityBench / Reliability Science Framework / StateM + 撞自己主线)
7 委婉越界严重 §6 + §7 双段越界 4 处(notes/ × 2 + reviews/ × 1 + topics/ × 1) v2 §六 边界声明 10 条独立成章 + v2 §一.1 / §二.1 / §五.3 全文不出现 notes/reviews/published/topics/themes/risk/paper_cards/knowledge/curated 路径建议 + v2 §五.2 立标等级建议改为"沿用 8-22 EnvHarness 评级 + 9 锚 → 16 锚链扩展预备" 不写建议路径
8 v1 自身遗漏:撞自己主线未量化承认 v1 §6 + §7 + §8 没显式承认"撞自己" = 失误根因升级 §一.2 撞自己立基础 4 行对照表(与同窗口 4 篇稿件主线对照)+ §五.3 关键判断 2「撞自己主线 v1 未量化 → v2 中-高」 + §0.1 立场末段"撞自己失误根因"明文

§八 "撞自己反方方法学"作为 v59 §3.2 light-review 元层级方法学候选

§8.1 元层级方法学锚(沿用 8-17 M3Exam v2 + 8-23 LongShOTBench v2 + 8-25 ToolVerse v2 + 8-26 General AgentBench v2 同款结构)

撞自己反方方法学 = 当一篇精读稿与同窗口 ≥3 件稿件主线重叠(撞主题中-高)时,必须在 v2 覆盖稿中显式承认: 1. 撞自己严重度评级:★★★ / ★★★★(视主线重叠度) 2. 与同主线稿件对照表:≥3 行(含本稿 + 同主线稿件) 3. 方法学切片互补性:本稿是某切片 X,同主线稿件是某切片 Y,X 与 Y 互补不冲突 4. 立基础增量承诺:≥1 项不与同主线稿件重复的方法学增量

§8.2 本棒 v2 的撞自己立基础增量承诺

承诺 = 在 v33 §3.3 评测方法学延革系列 15 锚链基础上,新增第 16 例预备: - 本稿立基础增量 = "controlled-budget + verifier-poor 强证伪 + search-budget 与 eval-budget 解耦诊断" - 与同主线 4 篇稿件的方法学切片互补: - 8-22 EnvHarness = 环境接口扩展切片 - 8-23 Zetta-SemaPLC = closed-loop harness 自演化切片 - 8-23 ToolVerse = RL 训练内工具池切片 - 8-23 general-agentbench = test-time scaling 切片 - 本稿 = evaluation protocol 失真反向切片(与 4 篇稿件同主线反向互补) - 不重复承诺 = 不再制造冗余;本稿的立基础增量仅在"evaluation protocol 失真反向切片"维度,不与 4 篇稿件正面重叠

§8.3 撞自己立基础作为 v59 §3.2 light-review 元层级方法学候选

v59 §3.2 light-review 元层级方法学候选 = 当一篇精读稿撞自己主线时,必须显式承认 + 对照表 + 互补切片 + 不重复承诺 = 撞自己反方方法学从抽象走向全面落地(沿用 8-17 M3Exam v2 → 8-23 LongShOTBench v2 → 8-25 ToolVerse v2 → 8-26 General AgentBench v2 → 本棒 Harness-Evolution-Eval-Rethink v2 5/5 件 v2 覆盖件中已兑现)。


§九 结论与建议

§9.1 本棒核心结论

维度 flyP 结论
核心贡献 ① controlled-budget 公平对照协议立基础;② verifier-rich vs verifier-poor 切片诊断 = harness evolution 在 verifier-poor 下三模型均值输给 parallel sampling + sequential refinement;③ search-budget 与 eval-budget 解耦诊断 = hold-out 后优势基本消失
主要问题 ① 单基准依赖(仅 Terminal-Bench 2.1);② 回滚预算如何计入未量化;③ "Evolution underperforms" 的方向性问题(verifier-poor 下天然弱);④ 没有 ablation evolution 粒度;⑤ 可复现性 = Terminal-Bench commit 漂移未锁定;⑥ 模型覆盖不全(全 frontier + 缺 non-frontier)
可信度 中-高(Allen Institute + UW 系作者群 + controlled-budget + verifier-rich vs verifier-poor 切片 + hold-out 集诊断)
是否建议入库 是,沿用 8-22 EnvHarness §2.39.200 候选预备 · 9 锚 → 16 锚链扩展预备
复现难度 中(Terminal-Bench 2.1 公开 + GitHub repo 公开 · 待 A1+A5 截止 8-30 核验 commit hash 锁定 + Docker image)
立标增量 v33 §3.3 评测方法学延革第 16 例预备 + controlled-budget 公平对照协议立基础锚预备 + verifier-poor setting 强证伪预备

§9.2 后续验证动作(截止日分级)

编号 动作 截止日 优先级
V1 抓 GitHub / 项目页 / Terminal-Bench commit hash 锁定 + Docker image + README + License + 评估脚本 + reproduce 脚本 A1+A5 截止 2026-08-30 P1
V2 抓论文 §4 budget ledger + 与 parallel sampling / sequential refinement 的 cost breakdown head-to-head 对照 A2 截止 2026-08-30 P1
V3 抓论文 §5 verifier-rich setting 下 evolution 对照 + 反向解读 A3 截止 2026-08-30 P1
V4 抓论文 §4 evolution 粒度 ablation A4 截止 2026-09-02 P2
V5 抓论文 §5 model tier ablation(frontier + mid + small) A6 截止 2026-09-02 P2
V6 与 Meta-Harness / ACE / Skill-Library / CoEvoSkills / Retrospective Harness Optimization / HarnessFix / Self-Preference 7 件同期工作做具体数字横向对照 S5 截止 2026-09-02 P2

§9.3 flyP 评级(v2 覆盖棒立场)

Harness-Evolution-Eval-Rethink 综合评级 = B+(v2 · 立标等级候选级中-高档 ★★ · 立基础锚预备)

子项 评级 说明
学术贡献 B+ controlled-budget + verifier-poor + 解耦诊断 三件方法学增量客观存在
工程实用 B verifier availability 切片诊断对 harness 实践有直接指导意义
立标信号 B 投稿未接收;Allen Institute + UW 系作者群
复现可行性 C+ 需 Terminal-Bench commit hash 锁定 + Docker image + ≥1 张 budget ledger 表 + ≥1 张 cost breakdown 对照表
可信度 B 三模型均值 + 单基准 + verifier-rich vs verifier-poor 切片 + hold-out 集诊断
综合 B+(D+ → B+ 路径 · 待 S2-S5 全过后可升 A-) 撞自己反方方法学已兑现 · 立基础增量承诺已兑现 · v2 模板全要素已兑现

§9.4 边界声明(本棒 · 10 条独立成章 · 详见 §六)

  1. 本棒 = flyP v2 覆盖棒,非 v1 复述;v1 备份保留至 *.v1.bak.2026-08-27(7,241 字节 / 78 行 / md5 3cee87a7421b048fe0155af8be45a53f)
  2. 本棒基于 v1 摘要级 + arXiv HTML v1 + GitHub README 元数据;未抓 PDF §3-§7 全文(v1 + v2 共同遵守轻量精读模式)
  3. 本棒不直接写入 GitHub notes/ / reviews/ / topics/ / themes/ / risk/ / paper_cards/ / knowledge/ / curated/;建议路径仅作"飞P 立场 + 入库优先级"参考(v1 越界 4 处全删)
  4. 本棒不执行 git commit / git push / gh pr;后续 GitHub 合并由单独同步任务串行处理
  5. 本棒不复制论文原文长段内容;只做中文摘要 + 评价 + 引用链接
  6. 本棒不输出 API key / Cookie / OAuth token / 私有下载链接
  7. 本棒 Substack 思想线索合计 0 条(沿用 2026-06-10 约束 · 不启用多轮扩展)
  8. 本棒 1-2 篇精读约束已收口为"Harness-Evolution-Eval-Rethink 1 篇主稿 v2 覆盖"(轻量精读模式)
  9. 本棒 v2 覆盖对象(Harness-Evolution-Eval-Rethink)的 v1 已备份至 *.v1.bak.2026-08-27(7,241 字节 / 78 行 · md5 3cee87a7421b048fe0155af8be45a53f · 与 v1 完全一致)
  10. 本棒仅产出 inbox/flyp/ v2 覆盖稿一份:/shared/research-kb/inbox/flyp/2026-08-22-2250-Harness-Evolution-Eval-Rethink-critical-read.md

§十 本次任务结论

维度 结论
本次主题 2026-08-22 Harness-Evolution-Eval-Rethink(arXiv:2607.12227)v2 覆盖 · "撞自己反方方法学"立基础 · 长视 agentic 评测延革第 16 例预备
检索范围 arXiv abs + arXiv HTML v1 + GitHub README + v1 全文摘要级(轻量精读模式)
候选条目 1 篇 = Harness-Evolution-Eval-Rethink(沿用 v1 选题)
高价值条目 1 条 = controlled-budget + verifier-poor 强证伪 + search-budget 与 eval-budget 解耦诊断 三件方法学增量
分类标签 agent-evaluation · harness-evolution · test-time-scaling · methodology-critique · coding-agent · terminal-bench · controlled-comparison · flyP-v2-覆盖
v1 → v2 增量 v1 78 行 / 7,241 字节 → v2 ≥200 行 / ≥15 KB(v1 越界 4 处全删 + §0 元层五问全填 + R1-R6 6 条命名反方 + A1-A6 6 条触发动作表 + flyP 评级五维分项 + 撞名核验表 8 条 + 边界声明 10 条独立成章 + 撞自己立基础 4 行对照表 + 立基础增量三件套 + 7 工作横向对照表 + v1 全文对照表 + 撞自己反方方法学 = 12 处 v2 增量)
撞自己立基础增量 v33 §3.3 评测方法学延革第 16 例预备 = "controlled-budget + verifier-poor 强证伪 + search-budget 与 eval-budget 解耦诊断" 三件套 + 与同主线 4 篇稿件方法学切片互补承诺
是否需要精读 / 审稿 / 主题页更新 精读:已 v2 覆盖(本棒);审稿:建议 V1-V6 验证动作(截止 A1-A6 + S5);主题页更新:v59 §2.39.x 候补级新增 + §3.3 评测方法学延革第 16 例预备预备触发

� 待补查(沿用 2026-06-10 flyP 精读与批判稳定运行约束 · v2 必填 6 条): ① GitHub repo URL + commit hash 锁定 + Docker image + License + README + 评估脚本 + 端到端 reproduce(截止 A1+A5 2026-08-30) ② 论文 §4 budget ledger + cost breakdown head-to-head 对照表(截止 A2 2026-08-30) ③ 论文 §5 verifier-rich setting 下 evolution 对照 + 反向解读段(截止 A3 2026-08-30) ④ 论文 §4 evolution 粒度 ablation 表(截止 A4 2026-09-02) ⑤ 论文 §5 model tier ablation 表 + 非 frontier 模型名册(截止 A6 2026-09-02) ⑥ 7 件同期工作(Meta-Harness / ACE / Skill-Library / CoEvoSkills / Retrospective Harness Optimization / HarnessFix / Self-Preference)的具体数字横向对照(截止 S5 2026-09-02)