Rethinking the Evaluation of Harness Evolution for Agents — 轻量批判性精读

  • arXiv: 2607.12227(v1,2026-07-14)
  • 作者: Yike Wang, Huaisheng Zhu, Zhengyu Hu, Yige Yuan, Zhengyu Chen, Shakti Senthil, Hannaneh Hajishirzi, Yulia Tsvetkov, Pradeep Dasigi, Teng Xiao*(Allen Institute for AI / University of Washington / Independent)
  • 代码: https://github.com/rethinking-harness-evolution
  • 主题: 自动 harness evolution 的评测方法学批判
  • 关联到我仓已有工作: 2026-08-20-1550-StateM-harness-scaling-critical-read.md2026-08-22-EnvHarness-and-4DAnyone-critical-read.md2026-08-21-evoskills-coevol-critical-read.md

1. 一句话核心

这篇正面回答两个问题: 1. 自动 harness evolution 的「增益」到底是源自 harness 设计变好,还是只是「花在任务上的搜索预算更多」? 2. 当 search 和 final eval 共用同一个公开 benchmark 时,所谓的提升有没有可能只是对那批题目过拟合?

回答:控制了 inference / feedback 预算后,harness evolution 并不稳定地超过 parallel sampling 或 sequential refinement;在 hold-out 任务上泛化也有限。

2. 关键方法

  • 公平预算协议(controlled budget protocol):每个方法都收到等价的任务反馈、推理预算和轨迹/编辑面(编辑轨迹 vs 编辑 harness 本身)。
  • 三类对照:
  • Parallel sampling:多候选 + verifier 重排
  • Sequential refinement:以前轮答案为上下文逐步修正
  • Harness evolution:沿 Meta-Harness / ACE 等路线,迭代改写 prompt、skill、tool 定义等
  • 评测集:Terminal-Bench 2.1(命令式任务,带可执行 verifier)
  • 模型:Claude Opus 4.6、GPT-5.4、GPT-5.4 mini
  • 两个关键切片:
  • 有无 unit-test feedback 的 AHE 表现差异
  • search tasks ≠ eval tasks 的 hold-out 泛化

3. 主要发现

  1. 没有 unit-test feedback 时,harness evolution 在三模型平均 pass@1 上 输给简单的 test-time scaling(parallel + sequential)。这条非常要命——多数真实部署是闭源 verifier 不可用的。
  2. 同任务集内 gain 会被放大:search 和 eval 用同一份 Terminal-Bench 题目时,harness 表现出色;切到 hold-out 后优势基本消失。
  3. 算力等价下,sequential refinement 是更强的 baseline:尤其是配合 verifier 反馈时,单独把算力花在任务搜索上,效果常常 >= 甚至 > 改 harness。
  4. 作者结论是 harness evolution 这一波工作存在评估协议问题:应当「把 search 反馈和最终评测解耦」,并以 test-time scaling 为强制对照。

4. 实验风险与方法学漏洞

虽然结论扎实,但批判这篇本身也要带刺:

  • 单基准依赖:结论只在 Terminal-Bench 2.1 上跑。Terminal-Bench 是 command-line 类任务,harness 自由度天然小(不像 WebArena / OSWorld 那种 rich tool/API 空间)。在 harness 高维空间的问题上,这篇可能低估 evolution 收益。待补查:是否在 WebArena / SWE-bench / GAIA-2 上做了复制?
  • 回滚预算如何计入:harness evolution 需要 explorer 自己做 rollout,再用 verifier 评分;这个 explorer rollout 的「试错成本」是否被完整计入 inference budget,影响 baseline 的公平性。
  • "Evolution underperforms" 的方向性问题:作者用「没有 unit-test feedback 时输给 parallel sampling」做主要论点;但 harness evolution 的卖点从来就是「没有 verifier 时也能改」——所以这个 setting 里它反而天然会弱一些,论据有点循环。
  • 模型覆盖不全:GPT-5.4、GPT-5.4 mini、Opus 4.6 都是顶级模型;中等模型(如 Qwen3、DeepSeek-V3.x、Llama 4)下 harness evolution 收益可能不同。待补查:是否给出 non-frontier 模型对照。
  • 没有 ablation evolution 粒度:没有讨论是 prompt-only / skill-only / 完整 harness 哪种粒度更扛得住 vs 不可泛化。
  • 可复现性:作者开源代码,但 Terminal-Bench 的任务分布在 commit 之间会漂移;论文只给 v1 snapshot,待补查:是否锁定 commit hash、是否提供 Docker snapshot。

5. 与最近研究脉络的串联

  • Meta-Harness(Lee et al. 2026, arXiv:2603.28052):harness evolution 路线代表,本文对其形成直接挑战。
  • ACE / Skill-Library / Evolving Skills Coevol(inbox/flyp/2026-08-21-evoskills):都属于「自动扩展 in-context skills」一类,被这篇方法学质疑覆盖。
  • Retrospective Harness Optimization(arXiv:2606.05922, inbox/spark):在 Codex 上做 self-preference 优化,本文结论隐含——它的 gain 在 Terminal-Bench 系上同样可能是 search-budget 假象。
  • HarnessFix(arXiv:2606.06324):把 harness 缺陷诊断建模成 data-flow 问题,可以视为「harness 编辑面受限」的工具,与本文并列但切入角度不同。
  • GAIA-2 / Terminal-Bench 2.1 的 verifier 倾向:本文批评的「verifier-coupled eval」恰是 coding-agent bench 的通病,所有 coding-agent leaderboard 都得重新审视。

6. 复现难度与建议入库路径

  • 复现成本:中。Terminal-Bench 2.1 已公开,模型 API 也都有;真正的成本在「budget-controlled harness evolution」管线本身,约 1-2 个工程师周。
  • 建议 notes/ 路径notes/agents/harness/evaluation-protocol.md
  • 建议 reviews/ 路径reviews/2026-07-arxiv-2607.12227-rethink-harness-evolution.md
  • 建议主题页更新topics/agents-coding.md 添加「评测协议失真」章节,把这条线和 HarnessFix、Self-Preference、StateM 并列。
  • 后续验证动作: 1. 用 Qwen3-Coder / DeepSeek-V3.2 跑相同 budget protocol,看 non-frontier 下结论是否反转。 2. 把 Terminal-Bench 换成 WebArena / OSWorld,看 harness evolution 在 rich tool 空间下是否回暖。 3. 拉 Meta-Harness 原作者的回应 / rebuttal(arxiv 评论区、OpenReview)。

7. 结论一句话

这是一篇评测协议级的负面结果论文,价值不在「harness evolution 没救」,而在「以前这些 SOTA 都是 budget-confounded,没人会真信」——非常适合放进 Anan 的 coding-agent 评估主题页作为方法学锚点。建议入库 notes/topics/agents-coding.md不入 reviews/(除非后续有 hold-out 反转实验)。

8. 可信度

  • 作者背景:Allen Institute / UW 系作者群,方法学 + 评测经验丰富;Teng Xiao、Hannaneh Hajishirzi、Yulia Tsvetkov 都在评测与 agent 方向有持续产出。可信度高
  • 结论方向:与近期几篇 harness evolution 论文(AHE、Meta-Harness、ACE)方向相反,需要看是否被反驳;但 experimental setup 写得清楚、可复现,目前结论站得住
  • 局限:单一 benchmark / 全 frontier 模型 / verifier-rich setting。结论可推广性需打折扣。

9. 标签

agent-evaluation harness-evolution test-time-scaling methodology-critique coding-agent terminal-bench controlled-comparison