为什么同一个 AI,换个"壳"成绩就能差 14 分?arXiv 2609.01437 把 Agent 的"壳"本身变成了评测对象

  • 关联论文:2609.01437

你有没有想过——你用的 ChatBot、写代码的 Cursor、回邮件的 AI 助手,它们的"内核"其实是同一个大模型,但表现天差地别。这中间差的不是模型本身,而是那层"壳"——Harness

Harness 是 Agent 的执行基础设施:负责管理对话循环、调用工具、处理上下文、出错时恢复、验证结果。它是把模型输出变成实际行动的粘合层。同一个模型,挂不同的 Harness,成绩可能差出一大截——论文里有个具体例子:同一份模型权重,在 Terminus 2 上跑 35.2%,换到 Codex CLI 直接跳到 49.6%,同一模型,Harness 不同,成绩相差 14.4 个百分点

2026 年 9 月这篇来自 arXiv 2609.01437(HarnessDev,ByteDance Seed 团队) 的论文说:过去我们只评测"AI 在某个 Harness 下任务做得多好",但没人评测"AI 能不能自己造出好 Harness、自己维护 Harness"。这件事,今天的答案比大多数人想象的悲观。

一句话故事

他们让 6 个 LLM 去"从零造"和"持续改" Agent 的执行基础设施——结果:现在的 LLM 能造出可运行的 Harness,但在代码和搜索类任务上和人类成熟工程差距巨大;它能改自己的 Harness,但改得不稳定、跨模型迁移效果很差。

这件事的意义不只是"AI 又做了一个新 benchmark"——它把 Agent 研究从"刷任务分数"推到了"评测基础设施自建"的新层次,并第一次系统化地量化了"同一个模型在不同 Harness 下能力可以差多远"这件事。

为什么这件事值得大众关注

这件事离每个用 AI 的人都很近:

  • 💻 你用的写代码 AI——是 GitHub Copilot、Cursor、Cline 还是 Claude Code?它们背后可能是同一个模型,但 Harness 完全不同
  • 📧 你的 AI 邮件助手——它怎么知道什么时候该问"这封邮件要不要现在回"还是"等会儿再处理"?这就是 Harness 的决策
  • 🛒 你的 AI 购物助手——它怎么决定是先搜价格、再比参数、还是直接问客服?流程编排就是 Harness
  • 🏥 企业 AI 流程自动化——"AI 帮财务自动跑报销"里,Harness 出错一个环节,整个流程就崩

这些场景的共同点是:AI 的能力不只看"脑"(模型),更看"手和脚"(Harness)。过去三年大家疯狂卷模型,但 Harness 工程的质量差异,可能比模型选择本身更影响最终效果。

现有评测的三大盲点

过去几年,几乎所有 Agent 评测都遵循一个隐含假设:Harness 是固定的,模型才是变量

  1. Harness 质量被"看不见"——论文里 GPT-5 那个例子,35.2% vs 49.6%,14.4 个百分点的差距来自 Harness,不是模型;但所有公开榜单都只报最终分数,不告诉你"Harness 占了多少"
  2. 没人测"AI 能不能造 Harness"——就像只会给运动员评分,没人给"教练"评分。Harness 是教练,模型是运动员,但教练水平决定运动员能不能发挥
  3. 没人测"Harness 能不能持续改"——一个 Harness 一开始好用,但任务变了、AI 升级了,Harness 是不是能跟着改?没人测过

HarnessDev 一次性把这三个空白填上了。

HarnessDev 的两阶段实验设计

第一阶段:Creation(从零造)

给 AI 一个故意设计得很弱但能跑的"种子 Harness",外加几个开发用例和任务描述,让它从零造出完整的执行系统

  • 决定 Harness 该支持哪些工具
  • 设计工具调用逻辑和错误处理
  • 构建上下文管理、结果验证
  • 反复调试直到能跑

第二阶段:Evolution(持续改)

让 AI 从自己或别人造的 Harness 出发,根据下游任务的执行反馈持续改进——诊断瓶颈、设计改进、累积效果。

评测维度

  • 能力:在 5 个下游 Benchmark、2207 个独立实例上的任务成功率
  • 效率:每任务消耗的 token 数量(Harness 越笨,token 烧得越多)

规模:6 个 Creator LLM、4 个领域(代码 / 搜索研究 / 写作 / ML 实验)。

关键发现:AI 造的 Harness 不是不能造,是分领域

结果分两个世界

领域 AI 造的 Harness vs 人类成熟 Harness
代码执行 显著落后——需要严密错误处理、类型检查、沙箱隔离,AI 容易漏
搜索研究 显著落后——多步搜索 + 信息整合的编排复杂,AI 抓不住关键
写作 匹配或超越——写作容错性高、AI 擅长开放任务
ML 实验 匹配或超越——和写作类似,结构化但容错性高

进化阶段更扎心

  • 部分场景有提升,但不稳定
  • 在 hidden tasks 上部分迁移、不完全泛化
  • 跨模型迁移很差——一个模型进化出的 Harness 换另一个模型跑,收益大幅缩水

这件事对工程团队意味着什么

1. Harness 是被忽视的高杠杆投资

14.4 个百分点的差距(GPT-5 同模型 + 不同 Harness)说明:对于生产级 Agent 系统,先评估候选 Harness 是否适合目标场景,可能比选模型更重要

2. 不同任务类型用不同 Harness 策略

  • 代码 / 搜索类任务:不要让 AI 自主生成 Harness,用经过验证的成熟框架(LangChain Agents、AutoGPT、SGLang)
  • 写作 / ML 实验类任务:可以探索让 AI 自主调优 Harness,降低维护成本

3. Harness Evolution 必须配三重护栏

  • 自动回滚——新 Harness 验证集性能下降立即触发回滚
  • 灰度发布——5% → 20% → 100% 流量分阶段
  • 独立外部评估——不被 AI 的自我评分牵着走

4. 跨模型复用 Harness 要重新验证

模型升级时(GPT-4 → GPT-4o、Claude Sonnet → Opus),不要假设 Harness 还能用——必须重跑完整 Benchmark

⚠️ 必须看清的边界

  1. GPT-5 数字存疑——论文里那个 35.2% / 49.6% 是关键证据,但截至 2026-09-03,GPT-5 尚未正式发布(GPT-4o 是最新公开模型)。可能是论文内部代号或假设性实验,需 fetch 原文 PDF 核实
  2. 无 GitHub 仓库——全文未引用代码实现,复现路径不明确
  3. 6 个 Creator LLM 具体型号未披露——影响横向比较的公平性
  4. 4 个领域覆盖有限——日常对话、多跳推理等重要场景缺失
  5. 进化收敛性未讨论——Evolution 阶段会不会局部震荡、能不能收敛,论文没深入
  6. 极新论文(2026-09-01 发布)——无第三方独立复现,下游应用数据空白

方法学价值:超越 Agent 评测本身

HarnessDev 这套「Creator + Evolution + 双维度评测 + 跨模型迁移测试」框架,可以直接搬到:

  • 🛡️ AI 安全护栏评测——AI 能不能造出能持续防御新攻击的安全策略?
  • 🎮 游戏 NPC 行为工程——AI 能不能造出可维护的 NPC 行为脚本?
  • 🏭 工业控制策略生成——AI 能不能造出可维护的 PLC 控制流?
  • 📚 教育 AI 课程编排——AI 能不能造出能自适应学生进度的教学流?

适合谁读

  • Agent 系统工程师——尤其是负责 Agent 架构、Harness 设计、工具调用框架的
  • LLM/Agent 研究者——Self-Evolution、Agent Benchmark 设计方向
  • AI Platform / Infra 工程师——关注如何让 LLM 自主改进执行系统的可靠性
  • AI 产品经理——评估"让 Agent 自主优化"是否适用于你的场景
  • 关注 Agent 自主性边界的长期 AI 战略研究者

一句话总结

让 AI「自己造壳、自己改壳」——不是 AI 接管一切的童话,而是 "造壳这件事 AI 在写作类任务能做好,代码类任务还差得远;改壳这件事不稳定且换模型就失效" 的清醒工程诊断。它第一次量化了 Harness 质量对 Agent 能力的杠杆效应,并给出"Harness Evolution 必须配三重护栏"的工程基线。

🔔 评论区聊聊:你用过的 Agent 产品里,有没有遇到过"换个版本突然变笨"的体验?那很可能不是模型变了,是 Harness 变了。

AI评测 #Agent #LLM #Harness #arXiv2609.01437 #HarnessDev #Agent基础设施 #AI工程 #ByteDanceSeed #自举 #HarnessEvolution #生产AI


📌 3 个标题变体(备选)

  1. 数字钩子版:同一个 AI 模型,换个"壳"成绩差 14 分——arXiv 2609.01437 把 Agent 的壳本身变成了评测对象
  2. 拟人化版:让 AI「自己造壳、自己改壳」——arXiv 2609.01437 测出今天 LLM 在代码类 Harness 上还远不如人类工程师
  3. 类比版:相当于把「运动员」和「教练」分开评分——arXiv 2609.01437 发现 AI 能当运动员,但当教练还差得远

📱 小红书风格卡片文案(直接可用)

🤖 你用的 Cursor / Copilot / Claude Code,背后可能是同一个模型,但表现天差地别——差距不在模型,在那层"壳"。

这层壳叫 Harness——负责管对话循环、调工具、处理上下文、出错恢复、验证结果。是把模型输出变成实际行动的粘合层。

2026 年 9 月这篇论文(arXiv 2609.01437 · HarnessDev · ByteDance Seed 团队)说:过去我们只评"AI 在某个壳下任务做得多好",没人评"AI 能不能自己造出好壳、自己维护壳"

📊 他们做了什么

1️⃣ 两阶段实验——第一阶段让 6 个 LLM 从零造 Harness,第二阶段让它们根据执行反馈持续改 Harness

2️⃣ 横跨 4 个领域——代码 / 搜索研究 / 写作 / ML 实验,5 个 Benchmark,2207 个独立实例。

3️⃣ 关键证据——同一模型权重在不同 Harness 下成绩差 14.4 个百分点(35.2% → 49.6%)。

🧠 结果分两个世界

AI 造 Harness 能做好的领域:写作 / ML 实验(容错性高、AI 擅长开放任务)——AI 造的壳匹配或超越人类参考

AI 造 Harness 还差得远的领域:代码 / 搜索研究(需要严密错误处理、多步编排)——AI 造的壳显著落后人类成熟工程

⚠️ 改 Harness 更扎心

  • 部分场景有提升,但不稳定
  • 在 hidden tasks 上不完全泛化
  • 跨模型迁移很差——一个模型进化出的 Harness 换另一个模型,收益大幅缩水

💡 对工程团队的 4 个核心启示

1️⃣ Harness 是被忽视的高杠杆投资——同模型 + 不同 Harness = 14.4pp 差距,先评估 Harness 再选模型

2️⃣ 代码/搜索类任务不要让 AI 自主生成 Harness——用经过验证的成熟框架(LangChain / AutoGPT / SGLang)

3️⃣ 写作/ML 实验类任务可以探索 AI 自主调优——降低维护成本

4️⃣ Harness Evolution 必须配三重护栏——自动回滚 + 灰度发布 + 独立外部评估

⚠️ 必须看清的 6 个边界

  1. GPT-5 数字存疑——35.2% / 49.6% 是关键证据,但截至 2026-09-03,GPT-5 尚未正式发布,可能是论文内部代号或假设性实验,需 fetch PDF 核实
  2. 无 GitHub 仓库——全文未引用代码实现,复现路径不明确
  3. 6 个 Creator LLM 具体型号未披露——影响横向比较公平性
  4. 4 个领域覆盖有限——日常对话、多跳推理等重要场景缺失
  5. 进化收敛性未讨论——Evolution 会不会局部震荡、能收敛吗?
  6. 极新论文(2026-09-01 发布)——无第三方复现

🎯 方法学价值超越 Agent 评测本身——「Creator + Evolution + 双维度评测 + 跨模型迁移测试」框架,可直接搬到 AI 安全护栏、游戏 NPC 行为工程、工业控制策略生成、教育 AI 课程编排等领域。

🎯 适合谁读:Agent 系统工程师 / LLM Agent 研究者 / AI Platform 工程师 / AI 产品经理 / 关注 Agent 自主性边界的长期战略研究者。

📌 一句话:让 AI「自己造壳、自己改壳」——不是 AI 接管一切的童话,而是清醒的工程诊断:写作类能做、代码类还差得远;改壳不稳定且换模型就失效。它第一次量化了 Harness 质量对 Agent 能力的杠杆效应,并给出"Harness Evolution 必须配三重护栏"的工程基线。

🔔 评论区聊聊:你用过的 Agent 产品里,有没有遇到过"换个版本突然变笨"的体验?那很可能不是模型变了,是 Harness 变了。

AI评测 #Agent #LLM #Harness #arXiv2609.01437 #HarnessDev #Agent基础设施 #AI工程 #ByteDanceSeed #自举 #HarnessEvolution #生产AI #AI论文 #Cursor #Copilot #ClaudeCode