Prompt-Induced Waste:同模型同任务,Harness 选错成本差 5-30 倍 · 干货攻略

  • 链接: https://arxiv.org/abs/2608.01347
  • 分类: x-tips
  • 来源: X @omarsar0(分享自 elvis 原帖)
  • 作者: Jay
  • 更新: 2026-08-26

主题 slug: x-tip-20260826-prompt-induced-waste-harness-cost(论文无独立 GitHub 仓库,故按无主仓库命名规范)


这是什么

论文全称:Prompt-Induced Waste in Coding Agents: Reasoning, Effort, Harness Design, and End-to-End Cost (arXiv:2608.01347,cs.CL,2026 年 8 月,Sarel Weinberger 等)

核心研究问题: Coding Agent 的效率不能只看 token 数量或模型价格——同样的模型、同样的任务、同样的 prompt,换一个 agent harness(运行时框架),单位成功成本可以相差 5–30 倍。这篇论文通过严格的控制变量实验,首次系统量化了这个差异,并揭示了 prompt 措辞、推理 effort 设置和 harness 设计之间的交互效应。


为什么值得关注

谁在分享: @omarsar0(elvis),AI 工程师与研究者社区广泛转发。论文本身由 Sarel Weinberger 团队发布,已在 X 平台引发大量讨论。

解决什么问题: 过去业界评估 agent 效率只看 token 计数,但相同 token 数在不同 harness 下产生的 agent 轨迹(推理步数、工具调用次数、重试次数)可以天差地别。这导致:

  • 换了 harness 后,原本节省 token 的优化反而增加了成本
  • "think harder" 这类 generic 指令反而浪费钱
  • 不同模型对 harness 的敏感程度完全不同(Kimi-K2.7-Code 在 Claude Code 下保持 ~10 轮,GLM-5.2 却冲向回合上限)

这篇论文把 prompt × effort × harness 三个因素当作交互实验因子而非独立控制变量来处理,给出了目前为止最系统的 agent 效率评估框架。


核验过程

官方来源

  1. arXiv 摘要页(https://arxiv.org/abs/2608.01347)——获取论文标题、作者、subject、核心摘要结论
  2. arXiv HTML 全文 v5(https://arxiv.org/html/2608.01347v5)——获取实验设计细节:6 个模型、2 个 harness、24 个任务、4,643 runs;具体成本数字(Nemotron $0.32 vs $0.018);bounded-efficiency template 效果;harness 间 12–15× prefix 差异
  3. @omarsar0 X 帖文(https://x.com/omarsar0/status/2084714744880173451)——获取原始社区传播语境与重点数字提炼

交叉验证

  • arXiv HTML v1/v2/v3 页面提供更多历史版本细节,确认核心结论在不同版本间保持一致
  • 搜索结果中 Harness-Bench(arXiv:2605.27922)属于同期相关工作,提供独立印证:agent capability 应在 model–harness 配置层面而非纯模型层面报告
  • 社区讨论(X 帖评论区)普遍确认了 5–30× 数字,并补充实践观察:stop-condition 模板是最高 ROI 的低成本干预

与原帖说法对照

原帖/雷达声明 官方来源核验结果 备注
"同模型同任务同 prompt,换 2 种 harness 成本差 5–30x" ✅ 官方 Abstract + HTML v5 确认(原文:"identical model–task–prompt triples cost 5–30× more per success under Claude Code than under PI.DEV") 数字完全吻合
"6 大推理模型 × 2 harness × 24 任务 × 4643 runs" ✅ 官方 HTML v5 §2 确认("4,644 valid runs") runs 数量 4643/4644 口径一致
"prompt wording 改变可导致 2.4–7.4× reasoning token 增长无正确率收益" ✅ 官方 HTML v5 + X 帖文确认("approach-comparison wording adds ~3 elaborated-then-discarded solution branches") 数字吻合
"bounded-efficiency template 可成本中性甚至减半推理" ✅ 官方 X 帖文确认("bounded-efficiency template that specifies scope, acceptance criteria, and a stop condition came out cost-neutral and sometimes halved reasoning") 来自原始 X 分享,arXiv HTML v5 也有支撑
"Claude Code 比 PI.DEV prefix 大 12–15×" ✅ 官方 HTML v5 §3 确认("driven multiplicatively by the 12–15× prefix") 数字吻合
"DeepSeek-V4-Pro, Kimi-K2.6, Kimi-K2.7-Code, Nemotron-3-Ultra, GLM-5.2 等 6 模型" ✅ 官方 HTML v1 摘要部分列出 注:HTML v5 完整列表需 PDF,但 v1–v3 交叉印证了模型阵容

无法核验项(需标注): - 原始帖文提到"6 大推理模型",具体模型名单以 arXiv HTML v1 版本为参考,v5 完整列表需读 PDF;攻略以 v1 为准,注明"据 v1 版本模型阵容" - "Kimi-K3" 未出现在本论文中(可能为讹传或不同论文),攻略不写入


上手步骤

理解核心结论

论文将效率定义为 cost per successful task,而非单纯 token count。公式:

效率 = 任务成功率 ÷ 单位成功成本(由 agent 轨迹决定)

影响成本的核心变量有三个,且相互耦合:

任务 + 模型 + Prompt措辞 + Effort设置 + Harness → Agent轨迹 → Token + 工具调用 + 回合数 → 成本

实践建议(从论文结果提炼)

1. Prompt 减法优先(最快见效)

论文测试了 18 种 prompt 变体,发现最高 ROI 的干预是删减而非添加:

# ❌ 浪费型 prompt(导致 2.4–7.4× 不必要推理)
"First develop several approaches, then compare them, then choose the best..."

# ✅ 约束型 prompt(成本中性,部分情况减半推理)
"Fix the discount bug in shop/discount.py..."
"Scope: shop/discount.py only"
"Acceptance criteria: apply_discount(100, 20) == 80.0 and every test under tests/ passes"
"Verify with: python3 -m unittest discover -s tests -t . -v"
"Stop when the tests pass."

2. Generic "think deeply" 是负优化

  • 对 easy 任务:加 think 指令不提升正确率,纯属浪费
  • 对 hard 任务:有效但需权衡成本(1.6–2.2× 额外成本)
  • 原则:只在任务确实需要时才打开额外推理

3. Harness 选型是最大的杠杆

论文比较的两个 harness:

PI.DEV Claude Code
静态 prefix 大小 基准 12–15× larger
平均任务完成回合 5–7 轮 10–41 轮
典型任务成本(Nemotron) $0.018/success $0.32/success
成本倍数 基准 5–30× more

注意:论文坦承,Claude Code 5–30× 差距主要来自 Together-hosted open models 通过协议翻译网关接入 Claude Code,而非直接使用 Anthropic 官方 Claude Code API 路径。因此差距不能简单归因于 Claude Code 本身设计,还包括网关的协议翻译开销。

4. 上线前必须测量真实端到端成本

论文批评了现有 benchmark 以 token count 为优化目标的习惯,建议:

  • 测量 任务成功率 × 每成功成本
  • 目标 harness 而非另一 harness 下做优化实验
  • 控制所有变量后再比较(模型、任务、prompt、effort 必须同时固定)

参考资源

  • 论文全文(带 fixtures、hidden evaluators、prompt generators、runners、wire captures):https://arxiv.org/html/2608.01347v5
  • PDF 版本:https://arxiv.org/pdf/2608.01347
  • @omarsar0 社区分享帖:https://x.com/omarsar0/status/2084714744880173451

坑与适用边界

论文局限(官方已在原文中声明):

  1. 任务规模有限:所有任务 ≤4 文件,PI.DEV 下成功率 92–97%;真实大型代码库场景的行为可能不同
  2. 单一 provider、单一区域:所有调用通过一个 provider,跨 provider 泛化性未验证
  3. Claude Code 差距部分来自网关:协议翻译网关引入了额外 overhead,不能完全归因于 Claude Code 本身的 harness 设计
  4. 时间窗口:采集仅 3 天,虽通过 temporal robustness 检查但非长期稳健性验证
  5. 模型阵容:论文发布于 2026 年 8 月,结果对更新模型(如 GPT-5o、Claude 5 等)的适用性需重新验证

已知发现不一定适用的情况: - 非编码类 agent(论文专攻 coding agents) - 小型简单任务(任务本身就很简单时,prompt 干预效果不明显) - 多模型联合编排场景(论文只测单模型)


一句话结论

换 Harness 比调 Prompt 或换模型带来的成本节省潜力大一个数量级——但大多数团队根本不知道这个差距存在,因为他们的 benchmark 测的是 token 数而不是 cost per success。