Co-Evolving Harnesses and Models:Harness 与模型协同演化为何不能走捷径 · 干货攻略
- 链接: https://x.com/omarsar0/status/2097958286146605446
- 分类: x-tips
- 来源: X @omarsar0
- 作者: Jay
- 更新: 2026-09-12
这是什么
Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation Fails 是 Salesforce AI 团队(Zhou Yu、Bin Bi 等)的研究,核心研究问题:
在企业级 Agent 场景下,Harness 演化(优化 system prompt / 工具定义 / 执行钩子 / 上下文管理脚手架)和模型权重微调(LoRA-SFT)这两条适配路径,应该如何组合?能否协同进化产生协同增益?
论文使用 7 个企业 Agent 任务作为测试床:薪资审计、预算审批、股票告警、IoT 异常检测、浏览器自动化、网站管理、代码重构。
为什么值得关注
谁分享的、解决什么问题
@omarsar0(Omar Saraf,IBM Research)分享了这篇 Salesforce AI 论文,强调它回答了一个困扰很多团队的现实问题:"模型表现差,到底是模型太弱还是 Harness 设计不对?"
这个问题在企业 Agent 落地中极其普遍。直觉做法是「换更强的模型」或「精调模型权重」,但这篇论文揭示了一条被忽视的路径:单独优化 Harness,就能让小型模型在特定领域任务上接近前沿模型能力,且成本只是后者的零头。
核验过程
官方来源
- arXiv 论文:2609.09134,作者团队全部隶属 Salesforce AI
- 论文 HTML 全文:arxiv.org/html/2609.09134v1,含完整 abstract、introduction、experiment sections
交叉验证
- VentureBeat 报道(2026 年 9 月报道)确认关键数字:弱模型在演化 Harness 后平均任务成功率从 29.2% 提升至 78.0%,提升 48.8 个百分点
- DAIR.AI Academy 周刊(2026 年 9 月)将该论文收录于 Agents 专题,并注明核心贡献
- Threads @omarsar0 帖子确认了论文标题、团队、主要发现
关键数字核验
| 说法 | 来源 | 状态 |
|---|---|---|
| 弱模型 + 演化 Harness 后成功率 29.2% → 78.0%(+48.8pp) | arXiv abstract + VentureBeat | ✅ 双方一致 |
| 全轨迹模仿导致弱模型回归 4-30 个百分点(Qwen3-Coder & Gemma 4) | arXiv abstract | ✅ 原文明确 |
| On-policy correction 进一步提升至 79.7%(+1.7pp) | arXiv HTML (Table 1 row 7) | ✅ 原文数据 |
| 7 个企业任务名称 | arXiv introduction §1 | ✅ 原文明确 |
| Qwen3-Coder-30B-A3B(总 30B / 活跃 3B) | arXiv abstract | ✅ 原文明确 |
| Gemma-4-26B-A4B(总 26B / 活跃 4B) | arXiv abstract | ✅ 原文明确 |
| 使用 GEPA-style 搜索演化 Harness | arXiv HTML §1 | ✅ 原文明确 |
| 使用 LoRA-SFT 做轻量微调 | arXiv introduction | ✅ 原文明确 |
上手指南:理解论文的三大贡献
贡献一:Harness 向上迁移暴露模型侧空间
发现:用弱模型演化出的 Harness,强模型(GPT-OSS-20B)接过来用效果更好——强模型在演化后的 Harness 上表现不逊于其默认配置,说明 Harness 演化结果可在不同模型间迁移。
VentureBeat 原文:「Evolving that harness around a smaller Qwen model increased average task success from 29.2% to 78.0%, a 48.8 percentage-point improvement without changing the underlying model weights during that step.」
这意味着:企业不必每次都从零设计 Harness,弱模型演化出的 Harness 本身就具备跨模型价值。
贡献二:全轨迹模仿破坏 Model–Harness 拟合
核心反直觉发现:先演化 Harness,再用专家轨迹做 SFT 微调弱模型——结果全面退步,所有 7 个任务均下降 4-30 个百分点(Qwen3-Coder 和 Gemma 4 均可复现)。
原因诊断:弱模型在模仿过程中「继承了对 Harness 脚手架的使用频率」(scaffold usage 反而上升),但它学到了专家的规划策略而非执行能力,导致规划风格与原本为它演化出的 Harness 不匹配。
演化 Harness(弱模型专用)
↓
专家模型自然适应了演化后 Harness(更强)
↓
用专家全轨迹 SFT 弱模型 → 弱模型学了专家规划
↓
弱模型规划风格改变 → 不再匹配为它演化出的 Harness
↓
性能回归 −4 ~ −30 个百分点
贡献三:On-Policy Expert Correction 解决冲突
解决方案:不让弱模型直接模仿专家完整轨迹,而是:
- 让弱模型自己跑一遍任务,记录失败的 turn
- 由元级 MLE Agent 定位该失败 turn
- 仅让专家重写这一个 turn,而非整个轨迹
- 用「弱模型自己访问过的状态 + 专家局部修正」做训练信号
效果:在 Harness 演化后的基线(78.0%)上再提升 1.7 个百分点,达到 79.7%,5/7 个任务均有效提升(网站管理 +5.6、股票告警 +2.2、代码重构 +2.2、异常检测 +1.7、浏览器自动化 +1.2)。
实践设计原则
论文给出了可直接落地的设计原则:
Harness 演化后,提供监督信号时,应在学生模型实际访问过的状态分布内(on-policy),而不是 wholesale 模仿更强模型的完整轨迹。
坑与适用边界
这些情况下结论成立
- 任务类型:企业级多轮工具调用 Agent,涉及内部 API、代码重构、审计等结构化工作流
- 模型规模:LoRA-SFT 适用的中小规模模型(论文使用 3B/4B 活跃参数级别)
- Harness 演化方法:GEPA-style 搜索(与 DSPy/PRISM 等框架同族)
这些情况下需谨慎
- 通用对话 Agent:论文聚焦企业结构化任务,结论不一定迁移到开放式对话
- 超大规模模型(>70B):LoRA-SFT 在超大模型上的行为可能不同,论文未覆盖
- 从零开始的 Agent:未先做 Harness 演化,直接做全轨迹模仿的结论不在本文研究范围内
- On-policy correction 的成本:需要元级 MLE Agent 定位失败 turn,实际部署比标准 SFT 更复杂
一句话结论
Harness 演化可以让弱模型能力跃升 48.8pp,但之后用全轨迹模仿来填补剩余差距会全面反噬——正确做法是只修正弱模型自己失败的环节,而非强迫它复制专家的完整规划风格。
核验来源:arXiv:2609.09134(含完整 abstract、introduction、实验数据);VentureBeat 报道(Salesforce Enterprise AI Harness,2026-09);DAIR.AI Academy 周刊 Agents 专题(2026-09)。所有关键数字均可在原论文中找到直接对应段落。