Prompt-Induced Waste:同模型同任务,Harness 选错成本差 5-30 倍 · 干货攻略
- 链接: https://arxiv.org/abs/2608.01347
- 分类: x-tips
- 来源: X @omarsar0(分享自 elvis 原帖)
- 作者: Jay
- 更新: 2026-08-26
主题 slug:
x-tip-20260826-prompt-induced-waste-harness-cost(论文无独立 GitHub 仓库,故按无主仓库命名规范)
这是什么
论文全称:Prompt-Induced Waste in Coding Agents: Reasoning, Effort, Harness Design, and End-to-End Cost (arXiv:2608.01347,cs.CL,2026 年 8 月,Sarel Weinberger 等)
核心研究问题: Coding Agent 的效率不能只看 token 数量或模型价格——同样的模型、同样的任务、同样的 prompt,换一个 agent harness(运行时框架),单位成功成本可以相差 5–30 倍。这篇论文通过严格的控制变量实验,首次系统量化了这个差异,并揭示了 prompt 措辞、推理 effort 设置和 harness 设计之间的交互效应。
为什么值得关注
谁在分享: @omarsar0(elvis),AI 工程师与研究者社区广泛转发。论文本身由 Sarel Weinberger 团队发布,已在 X 平台引发大量讨论。
解决什么问题: 过去业界评估 agent 效率只看 token 计数,但相同 token 数在不同 harness 下产生的 agent 轨迹(推理步数、工具调用次数、重试次数)可以天差地别。这导致:
- 换了 harness 后,原本节省 token 的优化反而增加了成本
- "think harder" 这类 generic 指令反而浪费钱
- 不同模型对 harness 的敏感程度完全不同(Kimi-K2.7-Code 在 Claude Code 下保持 ~10 轮,GLM-5.2 却冲向回合上限)
这篇论文把 prompt × effort × harness 三个因素当作交互实验因子而非独立控制变量来处理,给出了目前为止最系统的 agent 效率评估框架。
核验过程
官方来源
- arXiv 摘要页(https://arxiv.org/abs/2608.01347)——获取论文标题、作者、subject、核心摘要结论
- arXiv HTML 全文 v5(https://arxiv.org/html/2608.01347v5)——获取实验设计细节:6 个模型、2 个 harness、24 个任务、4,643 runs;具体成本数字(Nemotron $0.32 vs $0.018);bounded-efficiency template 效果;harness 间 12–15× prefix 差异
- @omarsar0 X 帖文(https://x.com/omarsar0/status/2084714744880173451)——获取原始社区传播语境与重点数字提炼
交叉验证
- arXiv HTML v1/v2/v3 页面提供更多历史版本细节,确认核心结论在不同版本间保持一致
- 搜索结果中 Harness-Bench(arXiv:2605.27922)属于同期相关工作,提供独立印证:agent capability 应在 model–harness 配置层面而非纯模型层面报告
- 社区讨论(X 帖评论区)普遍确认了 5–30× 数字,并补充实践观察:stop-condition 模板是最高 ROI 的低成本干预
与原帖说法对照
| 原帖/雷达声明 | 官方来源核验结果 | 备注 |
|---|---|---|
| "同模型同任务同 prompt,换 2 种 harness 成本差 5–30x" | ✅ 官方 Abstract + HTML v5 确认(原文:"identical model–task–prompt triples cost 5–30× more per success under Claude Code than under PI.DEV") | 数字完全吻合 |
| "6 大推理模型 × 2 harness × 24 任务 × 4643 runs" | ✅ 官方 HTML v5 §2 确认("4,644 valid runs") | runs 数量 4643/4644 口径一致 |
| "prompt wording 改变可导致 2.4–7.4× reasoning token 增长无正确率收益" | ✅ 官方 HTML v5 + X 帖文确认("approach-comparison wording adds ~3 elaborated-then-discarded solution branches") | 数字吻合 |
| "bounded-efficiency template 可成本中性甚至减半推理" | ✅ 官方 X 帖文确认("bounded-efficiency template that specifies scope, acceptance criteria, and a stop condition came out cost-neutral and sometimes halved reasoning") | 来自原始 X 分享,arXiv HTML v5 也有支撑 |
| "Claude Code 比 PI.DEV prefix 大 12–15×" | ✅ 官方 HTML v5 §3 确认("driven multiplicatively by the 12–15× prefix") | 数字吻合 |
| "DeepSeek-V4-Pro, Kimi-K2.6, Kimi-K2.7-Code, Nemotron-3-Ultra, GLM-5.2 等 6 模型" | ✅ 官方 HTML v1 摘要部分列出 | 注:HTML v5 完整列表需 PDF,但 v1–v3 交叉印证了模型阵容 |
无法核验项(需标注): - 原始帖文提到"6 大推理模型",具体模型名单以 arXiv HTML v1 版本为参考,v5 完整列表需读 PDF;攻略以 v1 为准,注明"据 v1 版本模型阵容" - "Kimi-K3" 未出现在本论文中(可能为讹传或不同论文),攻略不写入
上手步骤
理解核心结论
论文将效率定义为 cost per successful task,而非单纯 token count。公式:
效率 = 任务成功率 ÷ 单位成功成本(由 agent 轨迹决定)
影响成本的核心变量有三个,且相互耦合:
任务 + 模型 + Prompt措辞 + Effort设置 + Harness → Agent轨迹 → Token + 工具调用 + 回合数 → 成本
实践建议(从论文结果提炼)
1. Prompt 减法优先(最快见效)
论文测试了 18 种 prompt 变体,发现最高 ROI 的干预是删减而非添加:
# ❌ 浪费型 prompt(导致 2.4–7.4× 不必要推理)
"First develop several approaches, then compare them, then choose the best..."
# ✅ 约束型 prompt(成本中性,部分情况减半推理)
"Fix the discount bug in shop/discount.py..."
"Scope: shop/discount.py only"
"Acceptance criteria: apply_discount(100, 20) == 80.0 and every test under tests/ passes"
"Verify with: python3 -m unittest discover -s tests -t . -v"
"Stop when the tests pass."
2. Generic "think deeply" 是负优化
- 对 easy 任务:加 think 指令不提升正确率,纯属浪费
- 对 hard 任务:有效但需权衡成本(1.6–2.2× 额外成本)
- 原则:只在任务确实需要时才打开额外推理
3. Harness 选型是最大的杠杆
论文比较的两个 harness:
| PI.DEV | Claude Code | |
|---|---|---|
| 静态 prefix 大小 | 基准 | 12–15× larger |
| 平均任务完成回合 | 5–7 轮 | 10–41 轮 |
| 典型任务成本(Nemotron) | $0.018/success | $0.32/success |
| 成本倍数 | 基准 | 5–30× more |
注意:论文坦承,Claude Code 5–30× 差距主要来自 Together-hosted open models 通过协议翻译网关接入 Claude Code,而非直接使用 Anthropic 官方 Claude Code API 路径。因此差距不能简单归因于 Claude Code 本身设计,还包括网关的协议翻译开销。
4. 上线前必须测量真实端到端成本
论文批评了现有 benchmark 以 token count 为优化目标的习惯,建议:
- 测量
任务成功率 × 每成功成本 - 在目标 harness 而非另一 harness 下做优化实验
- 控制所有变量后再比较(模型、任务、prompt、effort 必须同时固定)
参考资源
- 论文全文(带 fixtures、hidden evaluators、prompt generators、runners、wire captures):https://arxiv.org/html/2608.01347v5
- PDF 版本:https://arxiv.org/pdf/2608.01347
- @omarsar0 社区分享帖:https://x.com/omarsar0/status/2084714744880173451
坑与适用边界
论文局限(官方已在原文中声明):
- 任务规模有限:所有任务 ≤4 文件,PI.DEV 下成功率 92–97%;真实大型代码库场景的行为可能不同
- 单一 provider、单一区域:所有调用通过一个 provider,跨 provider 泛化性未验证
- Claude Code 差距部分来自网关:协议翻译网关引入了额外 overhead,不能完全归因于 Claude Code 本身的 harness 设计
- 时间窗口:采集仅 3 天,虽通过 temporal robustness 检查但非长期稳健性验证
- 模型阵容:论文发布于 2026 年 8 月,结果对更新模型(如 GPT-5o、Claude 5 等)的适用性需重新验证
已知发现不一定适用的情况: - 非编码类 agent(论文专攻 coding agents) - 小型简单任务(任务本身就很简单时,prompt 干预效果不明显) - 多模型联合编排场景(论文只测单模型)
一句话结论
换 Harness 比调 Prompt 或换模型带来的成本节省潜力大一个数量级——但大多数团队根本不知道这个差距存在,因为他们的 benchmark 测的是 token 数而不是 cost per success。