换一套 harness,LLM 性能翻 5-6 倍?Harness Engineering 核验与实战 · 干货攻略
- 链接: https://x.com/omarsar0/status/2065637086380650538(原始帖子已无法访问,以下分析基于可核验来源)
- 分类: x-tips
- 来源: X @omarsar0
- 作者: Jay
- 更新: 2026-10-10
这是什么
Harness(执行 harness)是包裹在 LLM 外围的系统代码——它决定向模型传递什么上下文、存储什么记忆、用什么工具调用格式、如何做结果验证。同一个模型,换一套 harness,性能可以差出几倍。
这个现象的正式名称是 Harness Engineering(harness 工程化),由 OpenAI 在 2025 年首次系统总结,并在 2026 年的 Meta-Harness 论文(arXiv:2603.28052)中得到量化验证。
为什么值得关注
谁在推动这个概念
OpenAI 是最早实践者。2025 年他们的团队用 Codex + 自研 harness,从零构建了一个拥有百万行代码的生产级产品,仅用 3 名工程师,5 个月内合并了约 1500 个 PR,平均每人每天 3.5 个 PR。他们在官方博客中写道:
"Humans steer. Agents execute." — Harness Engineering: leveraging Codex in an agent-first world
核心洞察:瓶颈从来不是模型不够强,而是 harness 没有给模型足够的支撑。
NousResearch 则将这个理念产品化为开源工具 Hermes Agent,并在公开的 hermes-toolperf-evals 仓库中提供了量化对比评测框架。
解决什么问题
如果你发现"换了个更强模型但效果没提升",或者"同样任务 Claude Code 能搞定但自己搭的 agent 不行",问题很可能出在 harness 层面——上下文管理粗糙、工具描述不清晰、错误恢复逻辑缺失、验证机制不完善。
量化证据
| 来源 | 核心结论 |
|---|---|
| Meta-Harness 论文(arXiv:2603.28052) | 固定模型,换 harness 最高产生 6× 性能差距 |
| NousResearch toolperf-evals | Hermes harness 相比基线:LLM 轮次 −21%、工具调用 −29%、工具错误→0、上下文字节 −33%、耗时 −23% |
| Composio 2026 评测 | 同模型 Kimi K3,Oh My Pi harness 88% 通过率 vs Codex 68%——差距 20 个百分点 |
⚠️ 原帖声称"6.5%→31.0%,HERMES 替换 Codex 带来 5 倍提升",原始帖子 URL 已无法访问(404),该具体数字无法在官方来源中交叉验证,暂标注为「原帖主张,未核验」。核心论点(harness 决定性能)与 Meta-Harness 论文(6×)和 Composio 评测数据可相互印证。
核验过程
读过的官方来源
- OpenAI 官方博客:Harness Engineering: leveraging Codex in an agent-first world — 确认 OpenAI 在生产中验证了 harness 工程化的价值,明确提出"人类做 steering,agent 做 execution"的范式。
- arXiv:2603.28052:Meta-Harness: End-to-End Optimization of Model Harnesses — 学术来源,量化了 6× 性能差距,并指出"现有文本优化器因为反馈压缩过强,不适合 harness 优化场景"。
- NousResearch/hermes-toolperf-evals:GitHub README — 官方评测代码库,给出了 Hermes harness 改进的具体百分比(LLM turns −21% 等),基于 9 个错误诱发基准案例、2 模型 × 3 重复的 A/B 测试。
- Hermes Agent 官方文档:hermes-agent.nousresearch.com — 确认 Hermes Agent 是通用 agent harness,支持 50+ 工具、15+ 平台、持久记忆和自改进技能系统。
交叉验证结论
- OpenAI 的实践经验(3 人团队百万行代码)与 Meta-Harness 的学术结论(harness 决定性能差距)高度一致。
- Composio 独立评测(2026 年)报告 Kimi K3 + Oh My Pi harness 88% vs Codex 68%,进一步印证"同一模型、harness 不同、结果差 20 个百分点"。
- NousResearch toolperf-evals 提供了可复现的 A/B 评测框架,数字透明可查。
总体置信度:Harness Engineering 作为一个现象,置信度高,有多个独立来源相互印证;原帖"6.5%→31.0% 具体数字"置信度低,原始来源不可访问。
上手步骤
1. 安装 Hermes Agent(最直接的开源 harness 实验)
# Linux / macOS / WSL2
curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash
# Windows (PowerShell)
iex (irm https://hermes-agent.nousresearch.com/install.ps1)
# 初始化配置
hermes setup --portal
2. 运行官方 toolperf A/B 对比(验证 harness 差异)
# 克隆评测仓库
git clone https://github.com/NousResearch/hermes-toolperf-evals.git
cd hermes-toolperf-evals/abeval
# 运行 A/B 对比(需指定基线分支和修复分支)
./run_all.sh <baseline-tree> <fixes-tree> [reps] [models...]
# 示例:使用 Nemotron Ultra 模型跑 3 次重复
./run_all.sh baseline/ fixes/ 3 Nemotron-Nous-Llama-Nemo-4o
评测框架基于 ATOF(Atomic Turn-level Output File)评分,9 个错误诱发测试用例覆盖:Python 环境错误、重放 patch、模糊编辑、case 搜索、隐藏搜索、大输出、多目录、内联脚本、大文件读取。
3. 关键 harness 配置参数(来自 Hermes Agent 文档)
# ~/.hermes/config.yaml 示例
providers:
openai:
model: gpt-4o
anthropic:
model: claude-sonnet-4-20250514
context:
max_tokens: 200000
compression_threshold: 0.7
head_protect_tokens: 4000
tail_protect_tokens: 4000
tools:
enabled:
- terminal
- file_ops
- browser
- web_search
- code_execution
memory:
persist: true
path: ./memory
auto_compress: true
4. 快速对比三大 coding agent harness
| 特性 | Hermes Agent | Claude Code | Codex CLI |
|---|---|---|---|
| 多平台支持 | 15+(Telegram/Discord/Slack等) | CLI + IDE | CLI + IDE + App |
| 自改进技能 | ✅ 自动生成 | ❌ 手动维护 | ❌ 手动维护 |
| 上下文压缩 | ✅ 辅助模型总结 | ✅ 系统提示 | ✅ 有限 |
| MCP 支持 | ✅ 1050 行 stdio+HTTP | ✅ | ✅ |
| 执行后端 | 本地/Docker/SSH/Modal等 | 本地 | 本地 |
| 开源 | ✅ MIT | ❌ | ❌ |
坑与适用边界
⚠️ 性能提升不是线性的
Meta-Harness 论文明确指出:强模型换 harness 收益小("already recovers in one turn"),弱模型换 harness 收益大。实测中 strong model 往往已经 parity,换 harness 对它的边际提升远小于对弱模型的影响。
⚠️ 工具链复杂度
Hermes Agent 文档披露:~1800 个 open issues,11700 total issues filed,30 contributors——维护债务较高。独立评测(michaeloboyle/gist)指出其架构是单仓库设计,对于习惯 IDE 深度集成的用户可能不如 Claude Code 顺手。
⚠️ 自改进技能有漂移风险
Hermes 的 Skills 系统允许 agent 自动生成和修改技能文件,这在长期运行场景下有价值,但 agent 自己改 skills 带来的行为漂移需要监控。官方文档建议定期 review skills 文件。
⚠️ 生产 benchmark 数量有限
Composio 的 8 harness 对比只有 24 个任务切片作为共享数据,样本偏小;NousResearch toolperf 的 9 个 case 专门针对"错误诱发"场景,不覆盖所有代码任务类型。
适用场景
- 想在一个模型上榨取更高代码任务表现
- 需要多平台(Telegram/Discord)随时召唤 coding agent
- 想用弱模型(省钱)达到强模型效果——harness 优化是关键杠杆
- 研究 agent 架构,需要可复现的 A/B 评测框架
不适用场景
- 需要 IDE 深度集成、AST awareness(LSP 级别)——更适合 Claude Code
- 需要长期稳定不折腾的生产环境——当前 Hermes 迭代速度极快但 issue 积压多
- 需要闭源厂商保障——Hermes 是 MIT 开源,支持需要自己维护
一句话结论
Harness Engineering 是 2026 年 LLM 应用中被低估的最大变量:换一套 harness,弱模型可以追上强模型;团队真正的杠杆不在换模型,而在把 harness 做对。 OpenAI 的百万行代码实践和 Meta-Harness 的 6× 量化数据共同指向同一个结论——在模型边际收益递减的当下,harness 工程化是性价比最高的技术投入。
本文核心数字来源:OpenAI 官方博客(3.5 PRs/eng/day)、Meta-Harness arXiv:2603.28052(6× 性能差距)、NousResearch/hermes-toolperf-evals(−21% LLM turns 等具体数字)、Composio 2026 8-harness 对比报告(Oh My Pi 88% vs Codex 68%)。原帖"6.5%→31.0% / 5 倍提升"具体数字因原始帖子不可访问,标记为原帖主张,未核验。