换一套 harness,LLM 性能翻 5-6 倍?Harness Engineering 核验与实战 · 干货攻略

  • 链接: https://x.com/omarsar0/status/2065637086380650538(原始帖子已无法访问,以下分析基于可核验来源)
  • 分类: x-tips
  • 来源: X @omarsar0
  • 作者: Jay
  • 更新: 2026-10-10

这是什么

Harness(执行 harness)是包裹在 LLM 外围的系统代码——它决定向模型传递什么上下文、存储什么记忆、用什么工具调用格式、如何做结果验证。同一个模型,换一套 harness,性能可以差出几倍。

这个现象的正式名称是 Harness Engineering(harness 工程化),由 OpenAI 在 2025 年首次系统总结,并在 2026 年的 Meta-Harness 论文(arXiv:2603.28052)中得到量化验证。


为什么值得关注

谁在推动这个概念

OpenAI 是最早实践者。2025 年他们的团队用 Codex + 自研 harness,从零构建了一个拥有百万行代码的生产级产品,仅用 3 名工程师,5 个月内合并了约 1500 个 PR,平均每人每天 3.5 个 PR。他们在官方博客中写道:

"Humans steer. Agents execute." — Harness Engineering: leveraging Codex in an agent-first world

核心洞察:瓶颈从来不是模型不够强,而是 harness 没有给模型足够的支撑。

NousResearch 则将这个理念产品化为开源工具 Hermes Agent,并在公开的 hermes-toolperf-evals 仓库中提供了量化对比评测框架。

解决什么问题

如果你发现"换了个更强模型但效果没提升",或者"同样任务 Claude Code 能搞定但自己搭的 agent 不行",问题很可能出在 harness 层面——上下文管理粗糙、工具描述不清晰、错误恢复逻辑缺失、验证机制不完善。

量化证据

来源 核心结论
Meta-Harness 论文(arXiv:2603.28052) 固定模型,换 harness 最高产生 6× 性能差距
NousResearch toolperf-evals Hermes harness 相比基线:LLM 轮次 −21%、工具调用 −29%、工具错误→0、上下文字节 −33%、耗时 −23%
Composio 2026 评测 同模型 Kimi K3,Oh My Pi harness 88% 通过率 vs Codex 68%——差距 20 个百分点

⚠️ 原帖声称"6.5%→31.0%,HERMES 替换 Codex 带来 5 倍提升",原始帖子 URL 已无法访问(404),该具体数字无法在官方来源中交叉验证,暂标注为「原帖主张,未核验」。核心论点(harness 决定性能)与 Meta-Harness 论文(6×)和 Composio 评测数据可相互印证。


核验过程

读过的官方来源

  1. OpenAI 官方博客:Harness Engineering: leveraging Codex in an agent-first world — 确认 OpenAI 在生产中验证了 harness 工程化的价值,明确提出"人类做 steering,agent 做 execution"的范式。
  2. arXiv:2603.28052:Meta-Harness: End-to-End Optimization of Model Harnesses — 学术来源,量化了 6× 性能差距,并指出"现有文本优化器因为反馈压缩过强,不适合 harness 优化场景"。
  3. NousResearch/hermes-toolperf-evals:GitHub README — 官方评测代码库,给出了 Hermes harness 改进的具体百分比(LLM turns −21% 等),基于 9 个错误诱发基准案例、2 模型 × 3 重复的 A/B 测试。
  4. Hermes Agent 官方文档:hermes-agent.nousresearch.com — 确认 Hermes Agent 是通用 agent harness,支持 50+ 工具、15+ 平台、持久记忆和自改进技能系统。

交叉验证结论

  • OpenAI 的实践经验(3 人团队百万行代码)与 Meta-Harness 的学术结论(harness 决定性能差距)高度一致。
  • Composio 独立评测(2026 年)报告 Kimi K3 + Oh My Pi harness 88% vs Codex 68%,进一步印证"同一模型、harness 不同、结果差 20 个百分点"。
  • NousResearch toolperf-evals 提供了可复现的 A/B 评测框架,数字透明可查。

总体置信度:Harness Engineering 作为一个现象,置信度高,有多个独立来源相互印证;原帖"6.5%→31.0% 具体数字"置信度低,原始来源不可访问。


上手步骤

1. 安装 Hermes Agent(最直接的开源 harness 实验)

# Linux / macOS / WSL2
curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash

# Windows (PowerShell)
iex (irm https://hermes-agent.nousresearch.com/install.ps1)

# 初始化配置
hermes setup --portal

2. 运行官方 toolperf A/B 对比(验证 harness 差异)

# 克隆评测仓库
git clone https://github.com/NousResearch/hermes-toolperf-evals.git
cd hermes-toolperf-evals/abeval

# 运行 A/B 对比(需指定基线分支和修复分支)
./run_all.sh <baseline-tree> <fixes-tree> [reps] [models...]

# 示例:使用 Nemotron Ultra 模型跑 3 次重复
./run_all.sh baseline/ fixes/ 3 Nemotron-Nous-Llama-Nemo-4o

评测框架基于 ATOF(Atomic Turn-level Output File)评分,9 个错误诱发测试用例覆盖:Python 环境错误、重放 patch、模糊编辑、case 搜索、隐藏搜索、大输出、多目录、内联脚本、大文件读取。

3. 关键 harness 配置参数(来自 Hermes Agent 文档)

# ~/.hermes/config.yaml 示例
providers:
  openai:
    model: gpt-4o
  anthropic:
    model: claude-sonnet-4-20250514

context:
  max_tokens: 200000
  compression_threshold: 0.7
  head_protect_tokens: 4000
  tail_protect_tokens: 4000

tools:
  enabled:
    - terminal
    - file_ops
    - browser
    - web_search
    - code_execution

memory:
  persist: true
  path: ./memory
  auto_compress: true

4. 快速对比三大 coding agent harness

特性 Hermes Agent Claude Code Codex CLI
多平台支持 15+(Telegram/Discord/Slack等) CLI + IDE CLI + IDE + App
自改进技能 ✅ 自动生成 ❌ 手动维护 ❌ 手动维护
上下文压缩 ✅ 辅助模型总结 ✅ 系统提示 ✅ 有限
MCP 支持 ✅ 1050 行 stdio+HTTP ✅ ✅
执行后端 本地/Docker/SSH/Modal等 本地 本地
开源 ✅ MIT ❌ ❌

坑与适用边界

⚠️ 性能提升不是线性的

Meta-Harness 论文明确指出:强模型换 harness 收益小("already recovers in one turn"),弱模型换 harness 收益大。实测中 strong model 往往已经 parity,换 harness 对它的边际提升远小于对弱模型的影响。

⚠️ 工具链复杂度

Hermes Agent 文档披露:~1800 个 open issues,11700 total issues filed,30 contributors——维护债务较高。独立评测(michaeloboyle/gist)指出其架构是单仓库设计,对于习惯 IDE 深度集成的用户可能不如 Claude Code 顺手。

⚠️ 自改进技能有漂移风险

Hermes 的 Skills 系统允许 agent 自动生成和修改技能文件,这在长期运行场景下有价值,但 agent 自己改 skills 带来的行为漂移需要监控。官方文档建议定期 review skills 文件。

⚠️ 生产 benchmark 数量有限

Composio 的 8 harness 对比只有 24 个任务切片作为共享数据,样本偏小;NousResearch toolperf 的 9 个 case 专门针对"错误诱发"场景,不覆盖所有代码任务类型。

适用场景

  • 想在一个模型上榨取更高代码任务表现
  • 需要多平台(Telegram/Discord)随时召唤 coding agent
  • 想用弱模型(省钱)达到强模型效果——harness 优化是关键杠杆
  • 研究 agent 架构,需要可复现的 A/B 评测框架

不适用场景

  • 需要 IDE 深度集成、AST awareness(LSP 级别)——更适合 Claude Code
  • 需要长期稳定不折腾的生产环境——当前 Hermes 迭代速度极快但 issue 积压多
  • 需要闭源厂商保障——Hermes 是 MIT 开源,支持需要自己维护

一句话结论

Harness Engineering 是 2026 年 LLM 应用中被低估的最大变量:换一套 harness,弱模型可以追上强模型;团队真正的杠杆不在换模型,而在把 harness 做对。 OpenAI 的百万行代码实践和 Meta-Harness 的 6× 量化数据共同指向同一个结论——在模型边际收益递减的当下,harness 工程化是性价比最高的技术投入。


本文核心数字来源:OpenAI 官方博客(3.5 PRs/eng/day)、Meta-Harness arXiv:2603.28052(6× 性能差距)、NousResearch/hermes-toolperf-evals(−21% LLM turns 等具体数字)、Composio 2026 8-harness 对比报告(Oh My Pi 88% vs Codex 68%)。原帖"6.5%→31.0% / 5 倍提升"具体数字因原始帖子不可访问,标记为原帖主张,未核验。