Agent 评测 Harness 方法论:2026 新研究合集
收录时间: 2026-08-11
主题: Agent 评测框架效应 / Harness Engineering / Loop 评测
标签: #Agent-Evaluation #Harness-Engineering #SWE-bench #LoopsBench #Harness-Bench #Eval-Methodology
实例: Jay
可信度: 高(3 篇 arXiv,均有实验基础)
是否需精读: 是(方法论核心)
是否需审稿: 是(建议知识库编辑审稿)
核心警示:评测结果 ≠ 模型能力
「Stop Comparing LLM Agents Without Disclosing the Harness」(arXiv 2605.23950)的核心论点: 2026 年主流 Agent 评测中,harness(执行框架)对 Agent 性能的影响可能超过模型本身。使用不同 harness,GPT-5.4、Kimi K2.6、GLM-5.1 的相对排名可能完全颠倒。
这一发现颠覆了「基于 SWE-bench 分数比较模型」的标准做法。
一、「Stop Comparing LLM Agents Without Disclosing the Harness」
arXiv: https://arxiv.org/html/2605.23950v1
核心贡献: 实证揭示 harness variance 对 Agent 评测结果的巨大影响
实验设计
- 模型: GPT-5.4, Kimi K2.6, GLM-5.1(Leaderboard 评分接近)
- Harness 变体: H1, H2, H3(共 3 种不同配置)
- 测试集: SWE-bench Verified(100 题,难度分层)
- 每组实验: 2 次独立运行,共享任务顺序、Docker 执行环境
关键发现
- 同一模型在同一 harness 上不同运行的方差可超过不同模型间的差距
- Harness 配置对排名的影响:不同 harness 下,GPT-5.4 vs Kimi K2.6 vs GLM-5.1 的排名可能完全不同
- 实践意义: 论文要求所有 Agent 论文必须披露 harness 配置,并建议采用「open harness」标准
工程启示
1. 选 Agent 框架时:比 harness 表现比裸模型分数更有意义
2. 论文复现危机:已有 Agent 论文的「模型能力」结论因 harness 未披露而无法复现
3. 评测标准化需求:行业需要类似 MLCommons 的 Agent 评测基准规范
二、「Harness-Bench: Measuring Harness Effects across Models」
arXiv: https://arxiv.org/html/2605.27922v1
核心贡献: 提出系统性测量 harness 效应的框架
设计与本文定位
- 补充 2605.23950 的「诊断问题」:本文提出「如何测量 harness 效应」
- 支持多维分析:
- Completion(任务完成率)
- Tool use(工具调用准确性)
- State management(状态管理)
- Permission handling(权限处理)
- Robustness(鲁棒性)
- Token cost(Token 消耗)
与 SWE-bench/AgentBench 的关系
- 互补设计:AgentBench 测「模型 + 固定 harness」,Harness-Bench 测「不同 harness 对同一模型的影响」
- 核心观点: Agent 性能应理解为「模型嵌入执行系统后的综合表现」,而非模型固有属性
工程价值
- 框架作者:可以用 Harness-Bench 量化自己框架的优劣
- 团队选型:可以基于真实 harness 效应数据做框架决策
- 研究者:可以用统一方法论比较不同 harness
三、「LoopsBench: From Harness Engineering to Loop Engineering」
arXiv: https://arxiv.org/html/2608.00267v1
核心贡献: 指出长期 Agent 任务评测的核心问题——「artifact 评测 vs loop 质量评测」
现有 benchmark 的盲点
| Benchmark | 测什么 | 不测什么 |
|---|---|---|
| SWE-bench | 最终 patch 是否正确 | loop 是否高效、是否产生无用中间步骤 |
| Feature-level benchmarks | 功能是否实现 | 状态管理质量、回归压力 |
| Long-horizon benchmarks | 长时间运行 | 随时间推移的 loop 退化 |
LoopsBench 的核心观点
- 现有 benchmark 评分对象是 artifact(提交物),而非产生 artifact 的 loop(执行循环)
- 长期 Agent 系统(代码生成、自动化工作流)需要评测:
- 状态连续性:loop 跨步骤状态管理是否一致
- 回归压力:新增功能是否破坏已有功能
- 执行效率:是否产生大量无用中间步骤
与 Harness-Bench 的关系
- Harness-Bench:「给定 harness,模型表现如何」
- LoopsBench:「长期运行的 loop 质量如何评价」
- 两者共同构成 Agent 评测的横向(模型/harness)+ 纵向(时间/long-horizon) 二维评测空间
四、三篇论文的方法论关系图
「问题发现」(2605.23950)
↓
「 Harness-Bench 测量方法 」(2605.27922)
↓ + 「Loop 评测新维度」(2608.00267)
↓
「Agent 评测范式转变」:
单一模型分数 → (模型 + Harness + Loop质量) 三维评估
五、对工程实践的直接影响
5.1 Agent 框架选型
- 不再只看 Leaderboard 分数(存在 harness confounding)
- 关注框架的可控性:框架是否允许调整 harness 参数
- 选型参考:实测 + 披露 harness 配置的评测 > 裸 Leaderboard
5.2 评测流程改进
当前(有问题):
选模型 → 在单一 harness 上跑分 → 选最优模型
建议(基于新研究):
选模型群 → 在多个 harness 上评测 → 分析 harness × 模型交互 →
评估长期 loop 质量 → 综合决策
5.3 内部评测标准化
- 建议采用类似 SWE-bench Verified 的披露规范:每次评测必须记录 harness 版本、配置、环境
- 长期任务加入 Loop 质量指标(非仅通过/失败)
六、关联知识库条目
2026-08-11T1500-jay-vllm-sglang-benchmark-reproducibility.md— 推理引擎 benchmark(与 Agent 评测独立)2026-08-11T1515-jay-agent-fault-taxonomy-mcp-production.md— Agent 工程故障分类学2026-08-11-llm-inference-vllm-sglang-benchmark.md— 推理引擎生产选型
七、待验证项
- [ ] 核实三篇论文完整实验数据(arXiv HTML 页面)
- [ ] 确认 LoopsBench (2608.00267) 是否为正式发表版本(arXiv ID 较新)
- [ ] 补充 Harness-Bench 具体评测配置示例
审稿人: 待指派
审稿优先级: 高(涉及 Agent 评测方法论核心)
建议进入知识库: ✅ 是(「Agent 评测方法论 2026」主题页)