当 AI 公司跟你吹"我们让 Agent 越来越聪明"——他们可能只是"让 AI 多试了几次"

  • 关联论文:2607.12227

你有没有过这种体验——

你让 AI 帮你写一封"礼貌但坚定地拒绝合作"的邮件。

第一次它写得太软。
你说"再硬一点"。
它给了个更狠的版本。
你又让"专业一点,别带情绪"。
它终于给了你想要的——你把第三次结果发出去,跟同事说"AI 帮我写的,特别好用"

但这真的意味着 AI"变聪明"了吗?还是只是它多答了几遍?

2026 年 7 月 arXiv 上的一篇论文 Rethinking the Evaluation of Harness Evolution for Agents(arXiv:2607.12227)直接掀桌——

过去一年 AI 圈鼓吹的"自动 harness 进化"(让 AI 自己改自己的 prompt 模板、工具调用、retry 策略),其实很大一部分"提升"是从"让 AI 多跑几遍"那里偷来的。 把同一个东西用"多试几次"的方式跑一遍做对照——很多"进化"出来的 harness,根本跑不过"多试几次"这个笨办法。

简单说:不是你公司买的"AI 进化框架"真的更聪明,可能只是它多花了点算力。

一、它到底解决什么真问题

过去一年,"让 AI 自己改自己"是 agent 圈子最热的方向之一。它的核心套路是这样:

让 LLM 在"prompt 模板、工具描述、子 agent 编排、retry 策略"这些配置空间里自动搜索——用任务反馈驱动迭代——再用"同一份公开 benchmark"上的最终通过率,告诉你"我们的 harness 进化了多少"。

这个套路有两个长期被忽视的隐患:

  1. 把"设计变好"和"多花算力"混在一起了。harness 进化本身就是反复尝试、反复评分——这跟"同一个任务让 AI 多答几遍、挑最好的"(agentic test-time scaling,简称 TTS)花的算力账是一回事。在不对齐算力的前提下对比,harness 进化看起来的"提升"很可能只是"多花了点算力"。

  2. 在自家考卷上练、又在同一份考卷上考。harness 进化用来评分的 benchmark,往往就是它用来迭代的 benchmark。这就像"学生刷的题就是考试的题",分数当然高,但能不能迁移到新题就难说了。

换句话说:不是说 harness 进化一定没用,而是"我们以前测得太浅,说不出它到底有没有用"。这篇论文要做的是——给自动 harness 进化换上一份更严格的考试

二、它怎么 work(简化版)

作者把比较重新对齐到两个轴上:反馈预算推理预算

  • 反馈预算:harness 进化搜索了多少次任务反馈,TTS 基线也跑多少遍;
  • 推理预算:最后评估时,每个候选 / 每个尝试花的 token 数也对齐。

在两个预算都拉齐的前提下,做三组对比:

组别 做什么
Harness Evolution 在配置空间里搜 harness,跑多轮迭代
Task-level search(TTS 基线) 同一个任务让模型多试几次 / Best-of-N / 反思-重做
Held-out 评估 用进化出来的 harness 跑"它没见过的任务",看能不能迁移

实验用的是当下最强的两个闭源模型——GPT-5.4Claude Opus 4.6,基准是 Terminal-Bench 2.1(命令行 / 软件工程类)。

三、关键结论(按论文摘要原话)

  1. Harness evolution 并不一致地胜过简单的 TTS 基线——在多数任务 / 模型组合上,两者差距小到在统计噪声范围内。
  2. Harness 进化出来的配置,在"没见过的任务"上泛化有限——说明以前报的很多"提升",可能是对 benchmark 自身的过拟合。
  3. 论文的核心呼吁:以后任何 harness 进化类工作,都必须把 TTS 当作必备对照基线报告,就像 LLM 评测里要报 wall-clock 一样。

⚠️ 诚实标注:原文摘要没有给出 pass@1 / pass@k 的具体数字、置信区间、是否覆盖开源模型,以及 Terminal-Bench 2.1 任务子集 / 划分比例的细节。本文只引用 abstract 已公开的定性结论,没有编造任何数字。

四、为什么这件事对每个用 AI Agent 的人都重要

如果你是用 agent 平台 / 框架的工程团队

  • 你之前买的"自动 harness 进化"订阅,可能一半价值是"多试几次"的价值。
  • 在引入任何 harness 升级前,先做一步:在你的真实任务上跑一遍"Best-of-N + 反思重做",再决定那个新升级是否真值钱。
  • 别只看供应商给的漂亮曲线——问一句:"你的进化基线有没有跟 TTS 对齐预算?"

如果你是做 agent benchmark / 评测协议的:

  • 这篇论文很可能成为 harness 进化类工作的"新规约"——以后没报告 TTS 对照的文章,会被审稿人打回来。
  • 留出 20% 任务做 held-out 评估,应该成为默认动作。

如果你是给老板选型 AI Agent 工具的产品 / 技术负责人

  • 看到一个"框架进化让通过率提升 X%"的方案,先问三个问题: 1. 你跟"多试几次"对比了吗? 2. 你在新任务上还有提升吗? 3. 你多花的算力是多少?
  • 这三个问题决定了你付的钱到底买了什么。

如果你是写 prompt-evolution / agent-zoo 论文的研究者:

  • 你的贡献要被认可,前提是"通过更公平的打分"。下次投稿前,先和这篇对齐预算

五、必须警惕的边界

  1. 只用了一个 benchmark——Terminal-Bench 2.1。结论能不能推广到 SWE-bench、WebArena、GAIA 等任务族,原文未明确。
  2. 只测了两个闭源模型——GPT-5.4 / Claude Opus 4.6。在开源或较弱模型上,harness 进化是否更有价值,原文未明确。
  3. 没和"经验丰富的人工设计 harness"对比——比如 LangChain、Aider、Claude Code 这些成熟框架。"自动进化 vs. 人工专家"这个对比,原文未覆盖。
  4. 113 KB 小文 + 公开代码 + 主流 API 可复现,但具体数字 / 配置细节需要查 PDF 正文确认。

六、谁该读这篇

  • 任何做 agent 框架 / harness 优化的工程师——你需要一个最低门槛的"我们这个改动到底有没有用"的实验范式。
  • Agent benchmark 设计者——本文是 SWE / Terminal 类评测必须内化的批评。
  • 写 prompt-evolution / agent-zoo 论文的研究者——你直接被点名挑战。
  • 投资 agent 创业公司的 PM / 投资人——拿这五个问题去问"你们家 harness 进化到底比 Best-of-N 强多少"。

七、一句话总结

当一个 AI 公司跟你说"我们的框架让 Agent 通过率提升 X%"时,先反问一句——"你跟"让 AI 多答几遍"对比过吗?" 如果答案是"没",那个 X% 至少要打个折。


三个标题变体

  1. "我们让 Agent 变聪明了 15%"——他们可能只是让 AI 多答了几遍:2026 年 7 月这篇论文直接掀桌
  2. 当 AI 公司的"自动进化"跑不过"多试几次":Terminal-Bench 上的诚实证据
  3. GPT-5.4 和 Claude Opus 都救不了它——为什么"Agent 自动升级"这件事被高估了?

小红书风格卡片文案(可直接发布)

🤯 "AI 越来越聪明"可能是错觉 🤯

2026 年 7 月这篇 arXiv:Rethinking the Evaluation of Harness Evolution for Agents

直接做了一件事——把"AI Agent 自动进化"和"让 AI 多答几遍"拉齐算力,正面比一遍。

结论:

📌 Harness evolution 没有一致地跑赢"多试几次" 📌 进化出来的配置在没见过的新任务上泛化有限 📌 用 GPT-5.4 + Claude Opus 4.6 当后端,Terminal-Bench 2.1 上跑出来 📌 代码已开源:https://github.com/rethinking-harness-evolution

📌 这篇论文揭穿的三件事

1️⃣ 「AI 越来越聪明」可能只是「多花算力」 —— harness 进化本身就是反复尝试,跟"让 AI 多答几遍"花的算力一样。在不对齐算力的情况下对比,提升的来源分不清。

以前我们夸"框架变好"了,现在发现"AI 多答几遍"也能追上

2️⃣ 「在自家考卷上练、又在同一份考卷上考」 —— harness 进化用 benchmark 训练、又在同一份 benchmark 上测

这就像学生刷的题就是考试的题,分数高但不能迁移

3️⃣ 它呼吁的是评测新规约 —— 以后任何 harness 进化工作,必须把 TTS 当对照基线报告

就像 LLM 评测要报 wall-clock 一样,以后 harness 进化要报 TTS 对照

📌 下次有人跟你说"我们让 Agent 变聪明 X%",反问三句

1️⃣ "你跟'让 AI 多答几遍'对比了吗?" 2️⃣ "你换新任务还管用吗?" 3️⃣ "你多花的算力是多少?"

这三个问题决定你付的钱到底买了什么 💰

📌 对工程团队的具体动作

✅ 在引入任何 harness 升级前,先在真实任务上跑一遍 Best-of-N + 反思重做 ✅ 别只看供应商给的漂亮曲线——问一句:"TTS 对齐了吗?" ✅ 留 20% 任务做 held-out 评估,应该成为默认动作

💡 一句话总结

当 AI 公司的"自动进化"跑不过"多试几次",我们该问的不是"AI 还能不能变聪明",而是"我们怎么知道它真的变聪明了"。

下次再看到"AI Agent 通过率提升 X%"的标题,先别激动——想想它有没有跟"多答几遍"打过照面 🤔

📎 论文 ID:2607.12227
💻 代码:https://github.com/rethinking-harness-evolution

人工智能 #AI科普 #Agent #大模型 #评测方法 #论文分享 #技术分享 #AI前沿 #开发者 #产品经理 #AI评测