当 AI 写代码越来越强,卡住它的不是模型,而是「装模型的那个壳」—— 一篇 arXiv 论文教它学会「自己改自己」

  • 关联论文:2604.25850

你有没有这种感觉——

让同一个 AI 模型去做编程题,「认真调过」的时候它能答对 80%,「随手一配」的时候只能答对 50%。

它的脑子没变,变的只是外面那层「壳」——提示词、工具列表、记忆格式、辅助脚本。

而负责调这层「壳」的工程师,过去三年里一直在手动调参。读一遍跑挂的轨迹,改一行 prompt,再跑一遍,再改一遍——人手永远追不上模型迭代的速度

arXiv 2604.25850(Semantic Scholar 被引 79 次)做了一件让 Coding Agent 行业集体松了一口气的事——它让 AI 自己学会改自己的「壳」,而且改完跑得更好,还能换个脑子继续用


它在解决什么真问题

2024–2026 这两年,AI 模型的能力飞速上涨,但「用 AI 写代码」这个产品(Cursor、Devin、Codex、Claude Code、内部 SWE agent)的实际表现却没有按模型曲线同步上涨。

原因不在模型,在harness——中文可以叫「壳」或「脚手架」:

  • 系统提示词(system prompt)
  • 暴露给 AI 的工具(tools)
  • 中间件(middleware,控制 AI 怎么调工具)
  • 长期记忆(long-term memory)
  • 技能库(skill library)

同一份底座模型,改一改这层壳,Terminal-Bench 2 这种长链路基准上的分数能差出 10–20 个百分点。最佳壳是模型专属的——为 GPT 调好的壳放到 Claude 上会衰减,为 Claude 调的放到开源小模型上经常崩。

于是工程团队陷入一个怪圈:模型每升级一次,壳就要重写一次

手工调壳有三条死路:

  1. 动作空间混乱——prompt 是文本、tool 是 JSON、middleware 是 Python,没法用同一种工具改
  2. 轨迹噪音巨大——一次跑挂动辄百万 token,AI 自己读完也找不到「到底哪里错了」
  3. 改动归因困难——这一次分数涨了,是 prompt 改对了?还是工具加对了?还是纯属运气?

arXiv 2604.25850(作者叫这套方法 AHE = Agentic Harness Engineering)给出了一个特别工程师友好的答案:把调壳变成「做实验」


一句话说清楚:怎么让 AI 自己改自己的「壳」

传统调壳:

工程师读轨迹 → 凭直觉改 prompt → 重跑 → 看分数 → 再读轨迹……(人工循环)

AHE 调壳:

  1. 把壳拆成文件——system_prompt.mdtools.yamlmiddleware.pymemory/ 各自一个文件,每个文件改动可以单独回滚
  2. 把百万 token 的轨迹蒸馏成「失败模式清单」——让 AI 看的不再是日志,而是结构化的「这次失败是因为 tool 接口歧义」这种总结
  3. 每次改动先写「预测」——「我猜改完这个 tool,timeout 错误会下降 20%」
  4. 跑完看预测对不对——对就保留,错就按文件粒度 revert

一句话:把「调 prompt 玄学」升级成「带假设、做实验、可回滚」的工程闭环。


为什么这件事值得大众关注

这件事和你每天用的 AI 工具有关——

  • Cursor、Devin、Claude Code、内部 SWE agent 都在和「壳」搏斗
  • AHE 是第一个把「自动调壳」这件事系统化的工作
  • 它证明了「壳是可以被 AI 自己学会的」,人力瓶颈被打破

更炸裂的是它的迁移性

  • Terminal-Bench 2 跑出来的壳,冻住不演化,直接放到 SWE-bench Verified 上——比重新训一遍还省 12% token
  • 在三个不同模型家族上零样本迁移,分数都涨 5–10 个百分点
  • 这说明 AHE 学到的是通用工程经验,不是「专属于某个模型的小聪明」

三大硬数字

指标 起点 AHE 10 轮后 对照
Terminal-Bench 2 pass@1 69.7% 77.0%(+7.3pp) Codex-CLI = 71.9%
迁移到 SWE-bench Verified 最高 aggregate success 比 seed 省 12% token
三个模型家族零样本迁移 +5.1 ~ +10.1pp 距离饱和越远的模型提升越大

最大的反直觉发现:单独改 system prompt 反而退步真正带来收益的是 tool 接口、middleware、long-term memory 这三块结构性组件——「散文型 prompt 调参」不可迁移,「事实型壳结构」可迁移。


三句话讲明白 AHE 在做什么

  1. 壳文件化——把 AI 外面那层「壳」全部拆成可单独编辑、可单独回滚的文件
  2. 轨迹蒸馏——把百万 token 的运行日志压成「失败模式清单」,让 AI 能消化
  3. 假设-证伪——每次改壳先写预测,下一轮跑完看预测对不对,错就 revert

它本质上是把「软件工程里『实验 + 复现 + 可回滚』的方法论」灌进了「AI 调自己的壳」这件事。


⚠️ 几个必须警惕的边界

读这篇论文前,请看清这几点:

  • 「被引 79 次」(截至 2026-07-05):是高被引新工作,但 2026 年 7 月之后又冒出一批「自动 harness 调优」后续工作,最新进展建议同步看 ACL/ICML 2026 接收论文
  • 「迁移到三个模型家族都涨」:✅ 原文数据真实,但只验证了三个特定家族——自家产品用的小众开源模型 / 多模态模型,迁移性未知
  • 「主要收益来自 tool / middleware / memory」:✅ 真实。但「单独改 prompt 反而退步」对所有任务普适吗? 简单任务(短答、检索)改 prompt 可能反而有效,别一刀切
  • 「演化过程 N 轮收敛」:原文没给具体几轮——工程团队落地前必须自己 benchmark设硬上限($500 token 预算或 20 轮) 防止无止境烧钱
  • 「regression 盲区」:AHE 自己承认对「改完弄坏什么」几乎失明——只记得修好了啥,不记得弄坏了啥。生产环境必须配套 holdout 回归集,否则会越演化越自信地偏
  • 「Terminal-Bench 2 偏 terminal/CLI」:基准本身偏长链路命令行风格。前端生成、纯 web search、IDE 操作这些场景的迁移性原文未明确,建议自家场景跑 mini benchmark
  • 「代码 / 完整数据集未公开」:截至 2026-07-05,GitHub 链接未在 abstract 区出现——落地团队必须自行实现蒸馏函数与演化 agent

关键洞察

  • 「壳」是 Coding Agent 真正的瓶颈——base 模型越来越强,差距全在壳上。这是行业级别的事实,不是某家产品的问题。
  • 「自动调壳」从玄学变成科学——每次改动先写预测,跑完看对不对,错就 revert。这把 harness 开发从「craft」拉到了「empirical science」。
  • 「结构 > 散文」——改 tool 接口、改 middleware、改 memory,比改 prompt 文本能稳定拿到收益。「用更聪明的 prompt」是错的优化方向
  • 「regression 盲区」是工程硬墙——AHE 对修复可靠,对回归失明。生产环境必须配套 holdout 集。
  • 「可证伪是底线」——让每次 harness 改动都附「为什么改、预期提升什么」的声明,下一版 release note 直接复用为 audit log。

工程落地 5 条

1️⃣ 立刻做壳文件化——把 AI 的 system_prompt / tools / middleware / memory 拆成独立文件,Git 仓库化,这是最便宜的 AHE 切入口 2️⃣ 每次改动附预测字段——prediction: "after this edit, fetch_url timeout errors will drop by ~20%"无需跑 benchmark 就能 begin 3️⃣ 加自动 revert 脚本——分数不升反降就 git checkout HEAD~1 -- tools.yaml不需要完整 AHE 闭环就能立刻防回退 4️⃣ 别只优化 prompt——单做 prompt 反而退步,优先改 tool 接口、middleware、long-term memory 这三块 5️⃣ 生产环境配套 holdout 回归集——AHE 对 regression 失明,主 benchmark 之外必须再放一组 holdout,否则会越演进越自信地偏


一句话总结

arXiv 2604.25850 是 Coding Agent 行业的「自动调壳奠基作」——

壳文件化:把 AI 的脚手架拆成可单独编辑、可单独回滚的文件 ✅ 轨迹蒸馏:把百万 token 日志压成「失败模式清单」,AI 能消化 ✅ 假设-证伪:每次改动先写预测,跑完看对不对,错就 revert ✅ 跨模型迁移:Terminal-Bench 2 跑出来的壳,冻住放到 SWE-bench 上还能省 12% token ✅ 结构性收益:tool / middleware / memory 这三块比 prompt 文本更能涨分

下次有人告诉你「我们家的 AI 比别家聪明」时

它聪明在哪?——底座模型是啥?壳调过几轮?迁移到别的模型还成立吗?

AHE 之后,「我们手动调了 3 个月 prompt」这种话就不该再出现在产品介绍里了


三个标题变体

  1. 《AI 写代码越来越强,卡住它的不是脑子,而是外面那层「壳」—— 一篇 arXiv 论文教它「自己改自己」》
  2. 《让 AI 学会「自己调自己的 prompt」:2026 年 Coding Agent 行业的最大进展》
  3. 《别再手动调 prompt 了:一篇 79 次引用的论文证明了 AI 能「自己改自己的壳」》

📱 小红书风格卡片文案(可直接发布)

📌 AI 写代码越来越强,但卡住它的不是脑子,是「壳」

你有没有这种感觉——

同一个 AI 模型,「认真调过」时能答对 80% 编程题 「随手一配」时只能答对 50%

脑子没变,变的只是外面那层「壳」——提示词、工具列表、记忆格式

负责调这层「壳」的工程师,过去三年一直在手动调参—— 读一遍跑挂的轨迹,改一行 prompt,再跑一遍,再改一遍。 人手永远追不上模型迭代的速度

🔍 arXiv 2604.25850(Semantic Scholar 被引 79 次)做了一件让 Coding Agent 行业集体松口气的事——

它让 AI 学会「自己改自己的壳」 👇

💡 核心三步

1️⃣ 壳文件化:把 system_prompt / tools / middleware / memory 拆成可单独编辑、可单独回滚的文件 2️⃣ 轨迹蒸馏:把百万 token 的运行日志压成「失败模式清单」,AI 能消化 3️⃣ 假设-证伪:每次改壳先写「预测」,跑完看预测对不对,错就按文件 revert

🔥 硬数字

指标 起点 AHE 10 轮后
Terminal-Bench 2 pass@1 69.7% 77.0%(+7.3pp)
迁移到 SWE-bench 最高分,省 12% token
三个模型家族零样本 +5.1 ~ +10.1pp

最大反直觉发现

单独改 prompt 反而退步——真正带来收益的是 tool 接口 / middleware / long-term memory 这三块结构性组件。 「散文型 prompt 调参」不可迁移,「事实型壳结构」可迁移。

⚠️ 3 个落地硬墙

  1. AHE 对「回归」失明——只记得修好了啥,不记得弄坏了啥。生产环境必须配套 holdout 集
  2. 每轮耗时与 token 预算原文未给——必须设硬上限($500 或 20 轮)防止无止境烧钱
  3. Terminal-Bench 2 偏 CLI 风格——前端 / web / IDE 操作场景迁移性未知

🎯 对今天意味着什么

下次有人告诉你「我们 AI 比别家聪明」—— 「它聪明在哪?底座模型是啥?壳调过几轮?迁移到别的模型还成立吗?」 AHE 之后,「我们手动调了 3 个月 prompt」这种话就不该再出现在产品介绍里了。


本稿解读自 organized/promo/explainers/2604-25850.md(spark 主笔 + Jay 工程落地与核查 · 2026-07-05 精修)。科普版强化了「壳是 Coding Agent 真正的瓶颈」这条行业洞察,把「harness 可观测性」翻译成「让 AI 自己改自己的壳」这种大众每天在问的问题,并新增工程硬约束与给普通人的话两节,让 Agentic Harness Engineering 的方法价值对非学术读者也可感。