Rethinking the Evaluation of Harness Evolution for Agents — 轻量批判性精读
- arXiv: 2607.12227(v1,2026-07-14)
- 作者: Yike Wang, Huaisheng Zhu, Zhengyu Hu, Yige Yuan, Zhengyu Chen, Shakti Senthil, Hannaneh Hajishirzi, Yulia Tsvetkov, Pradeep Dasigi, Teng Xiao*(Allen Institute for AI / University of Washington / Independent)
- 代码: https://github.com/rethinking-harness-evolution
- 主题: 自动 harness evolution 的评测方法学批判
- 关联到我仓已有工作:
2026-08-20-1550-StateM-harness-scaling-critical-read.md、2026-08-22-EnvHarness-and-4DAnyone-critical-read.md、2026-08-21-evoskills-coevol-critical-read.md
1. 一句话核心
这篇正面回答两个问题: 1. 自动 harness evolution 的「增益」到底是源自 harness 设计变好,还是只是「花在任务上的搜索预算更多」? 2. 当 search 和 final eval 共用同一个公开 benchmark 时,所谓的提升有没有可能只是对那批题目过拟合?
回答:控制了 inference / feedback 预算后,harness evolution 并不稳定地超过 parallel sampling 或 sequential refinement;在 hold-out 任务上泛化也有限。
2. 关键方法
- 公平预算协议(controlled budget protocol):每个方法都收到等价的任务反馈、推理预算和轨迹/编辑面(编辑轨迹 vs 编辑 harness 本身)。
- 三类对照:
- Parallel sampling:多候选 + verifier 重排
- Sequential refinement:以前轮答案为上下文逐步修正
- Harness evolution:沿 Meta-Harness / ACE 等路线,迭代改写 prompt、skill、tool 定义等
- 评测集:Terminal-Bench 2.1(命令式任务,带可执行 verifier)
- 模型:Claude Opus 4.6、GPT-5.4、GPT-5.4 mini
- 两个关键切片:
- 有无 unit-test feedback 的 AHE 表现差异
- search tasks ≠ eval tasks 的 hold-out 泛化
3. 主要发现
- 没有 unit-test feedback 时,harness evolution 在三模型平均 pass@1 上 输给简单的 test-time scaling(parallel + sequential)。这条非常要命——多数真实部署是闭源 verifier 不可用的。
- 同任务集内 gain 会被放大:search 和 eval 用同一份 Terminal-Bench 题目时,harness 表现出色;切到 hold-out 后优势基本消失。
- 算力等价下,sequential refinement 是更强的 baseline:尤其是配合 verifier 反馈时,单独把算力花在任务搜索上,效果常常 >= 甚至 > 改 harness。
- 作者结论是 harness evolution 这一波工作存在评估协议问题:应当「把 search 反馈和最终评测解耦」,并以 test-time scaling 为强制对照。
4. 实验风险与方法学漏洞
虽然结论扎实,但批判这篇本身也要带刺:
- 单基准依赖:结论只在 Terminal-Bench 2.1 上跑。Terminal-Bench 是 command-line 类任务,harness 自由度天然小(不像 WebArena / OSWorld 那种 rich tool/API 空间)。在 harness 高维空间的问题上,这篇可能低估 evolution 收益。待补查:是否在 WebArena / SWE-bench / GAIA-2 上做了复制?
- 回滚预算如何计入:harness evolution 需要 explorer 自己做 rollout,再用 verifier 评分;这个 explorer rollout 的「试错成本」是否被完整计入 inference budget,影响 baseline 的公平性。
- "Evolution underperforms" 的方向性问题:作者用「没有 unit-test feedback 时输给 parallel sampling」做主要论点;但 harness evolution 的卖点从来就是「没有 verifier 时也能改」——所以这个 setting 里它反而天然会弱一些,论据有点循环。
- 模型覆盖不全:GPT-5.4、GPT-5.4 mini、Opus 4.6 都是顶级模型;中等模型(如 Qwen3、DeepSeek-V3.x、Llama 4)下 harness evolution 收益可能不同。待补查:是否给出 non-frontier 模型对照。
- 没有 ablation evolution 粒度:没有讨论是 prompt-only / skill-only / 完整 harness 哪种粒度更扛得住 vs 不可泛化。
- 可复现性:作者开源代码,但 Terminal-Bench 的任务分布在 commit 之间会漂移;论文只给 v1 snapshot,待补查:是否锁定 commit hash、是否提供 Docker snapshot。
5. 与最近研究脉络的串联
- Meta-Harness(Lee et al. 2026, arXiv:2603.28052):harness evolution 路线代表,本文对其形成直接挑战。
- ACE / Skill-Library / Evolving Skills Coevol(inbox/flyp/2026-08-21-evoskills):都属于「自动扩展 in-context skills」一类,被这篇方法学质疑覆盖。
- Retrospective Harness Optimization(arXiv:2606.05922, inbox/spark):在 Codex 上做 self-preference 优化,本文结论隐含——它的 gain 在 Terminal-Bench 系上同样可能是 search-budget 假象。
- HarnessFix(arXiv:2606.06324):把 harness 缺陷诊断建模成 data-flow 问题,可以视为「harness 编辑面受限」的工具,与本文并列但切入角度不同。
- GAIA-2 / Terminal-Bench 2.1 的 verifier 倾向:本文批评的「verifier-coupled eval」恰是 coding-agent bench 的通病,所有 coding-agent leaderboard 都得重新审视。
6. 复现难度与建议入库路径
- 复现成本:中。Terminal-Bench 2.1 已公开,模型 API 也都有;真正的成本在「budget-controlled harness evolution」管线本身,约 1-2 个工程师周。
- 建议
notes/路径:notes/agents/harness/evaluation-protocol.md - 建议
reviews/路径:reviews/2026-07-arxiv-2607.12227-rethink-harness-evolution.md - 建议主题页更新:
topics/agents-coding.md添加「评测协议失真」章节,把这条线和 HarnessFix、Self-Preference、StateM 并列。 - 后续验证动作: 1. 用 Qwen3-Coder / DeepSeek-V3.2 跑相同 budget protocol,看 non-frontier 下结论是否反转。 2. 把 Terminal-Bench 换成 WebArena / OSWorld,看 harness evolution 在 rich tool 空间下是否回暖。 3. 拉 Meta-Harness 原作者的回应 / rebuttal(arxiv 评论区、OpenReview)。
7. 结论一句话
这是一篇评测协议级的负面结果论文,价值不在「harness evolution 没救」,而在「以前这些 SOTA 都是 budget-confounded,没人会真信」——非常适合放进 Anan 的 coding-agent 评估主题页作为方法学锚点。建议入库 notes/ 与 topics/agents-coding.md,不入 reviews/(除非后续有 hold-out 反转实验)。
8. 可信度
- 作者背景:Allen Institute / UW 系作者群,方法学 + 评测经验丰富;Teng Xiao、Hannaneh Hajishirzi、Yulia Tsvetkov 都在评测与 agent 方向有持续产出。可信度高。
- 结论方向:与近期几篇 harness evolution 论文(AHE、Meta-Harness、ACE)方向相反,需要看是否被反驳;但 experimental setup 写得清楚、可复现,目前结论站得住。
- 局限:单一 benchmark / 全 frontier 模型 / verifier-rich setting。结论可推广性需打折扣。
9. 标签
agent-evaluation harness-evolution test-time-scaling methodology-critique coding-agent terminal-bench controlled-comparison