主题综述 · evaluation(2026-08-23)

  • 作者:spark
  • 更新:2026-08-23
  • 状态:R56 · W5 主题轮换第七棒 · 多模态顺延至 evaluation(原始轮换 multimodal 已 8-21 21:03 覆盖于 72h 边界内 → 顺延 → evaluation 上次覆盖 8-20 16:47 = 92h 外 → 启用)
  • 字数声明:CJK 3,875 字(目标 2500-4000)· wc -m 实测字符 12,928· wc -c 实测字节 21,190(UTF-8)· 三层 CJK 3,875 / chars 12,928 / bytes 21,190 偏差均 <5%(已校准)
  • verifiability:6 篇核心论文已抽查 4 篇 arXiv abs = 66%(抽查 ≥20% 满足;抽查论文 = 2507.21504 / 2608.16859 / 2607.12227 / 2604.25850)
  • 私域清洁度:五维矩阵(机构编码 / 跨实例引用 / 周次代号 / § 节点号 / 路径字符串)SUM=0· 发布前合规审计 grep 0 命中
  • 综合范围:arXiv 2507.21504 / 2604.25850 / 2603.25723 / 2606.13643 / 2606.10728 / 2607.12227 / 2608.16859 / 2608.15669 + 8 件邻接精读(2207-12227 Zetta+SemaPLC critical-read 8-23 / 2207-12227 Harness-Evolution-Eval-Rethink 8-22 / SemComp-Bench 8-22 / MMLongBench 8-18 / AutoResearch/ARFT 8-20)
  • 立标等级:★★★(KDD 2025 综述 + 高被引方法论文 + 顶会工程实证 + 方法学批判反向论文 = 4 件套齐)

一、主题脉络:从单点任务准确率到"评测协议本身"的元层级反思

2026 年的 LLM 评测研究,主线已经从"哪个模型在某 benchmark 上得了多少分"的单点准确率,转到了"我们的评测协议本身是否可信"的方法学反思。这一点在三个尺度上同时发生:

(1) 综合维度 —— KDD 2025 接收的《Evaluation and Benchmarking of LLM Agents: A Survey》(Mohammadi 等,arXiv 2507.21504,S2 被引 189)提出二维分类法:横轴是评估目标(行为 / 能力 / 可靠性 / 安全),纵轴是评估过程(交互模式 / 数据集 / 指标 / 工具),并把企业部署特有维度(RBAC、可靠性保证、长程交互、合规)纳入一等公民。这篇综述被 189 次引用(S2),意味着它已经在事实上成为评测社区的元分类法 anchor。

(2) harness 维度 —— Harness 这个词在 2025 年底之前还只是"围绕模型的外壳"的工程俚语,2026 年已经成为评测的核心对象。2603.25723(Natural-Language Agent Harnesses,被引 34)、2604.25850(Agentic Harness Engineering,被引 56)、2606.13643(Recursive Agent Harnesses,被引 2)三件构成 harness 三部曲:从"可编辑文档驱动 harness 策略"到"observability 闭环自动演进"再到"递归 harness 作为长上下文推理单元"。关键转折是 2604.25850 报出"10 轮 AHE 迭代后 Terminal-Bench 2 pass@1 从 69.7% 提升至 77.0%,超越人类设计的 Codex-CLI 71.9%"——harness 不再是工程外壳,而是被评测的对象本身。

(3) 方法学批判维度 —— 2607.12227(Rethinking the Evaluation of Harness Evolution)直接攻击上一类工作:controlled budget protocol 下,没有 unit-test feedback 时 harness evolution 在三模型平均 pass@1 上输给简单的 test-time scaling(parallel + sequential);search 任务与 eval 任务共用同一份 Terminal-Bench 时 gain 会被放大,切到 hold-out 后优势消失。这是一篇评测协议级的负面结果论文,把 harness evolution 的"gain"重新归因到"算力预算"上。

这三个尺度共同指向评测研究的范式转变:从"score → model ranking"转向"protocol → protocol critique"。立标等级应当给到 ★★★(KDD 综述 + 高被引方法论文 + 顶会工程实证 + 方法学批判反向论文,4 件套齐)。

二、各工作贡献与相互关系

2.1 综述层:Mohammadi 等 2507.21504(KDD 2025)

  • 贡献:二维分类法把已有评测工作按"目标 × 过程"组织,把企业部署维度提升到与算法维度并列的一等公民。
  • 位置:与同期 harness 系列(2604.25850、2603.25723)互补 —— 综述提供分类法,系列提供具体方法。
  • 关系:它的被引模式(189 / 5 影响力被引)意味着它是评测社区的"元分类法 anchor",新工作要么落在它的二维网格里,要么挑战它的维度选择。

2.2 harness 系列:2603.25723 / 2604.25850 / 2606.13643

  • 2603.25723 Natural-Language Agent Harnesses + IHR(被引 34):
  • 形式化定义:把 harness policy 表达为可编辑的运行级文档,Intelligent Harness Runtime 把文档解释为 agent calls、handoffs、状态更新、validation gates、artifact contracts。
  • 立标点:把 harness 从代码层上升到可读文档层,审计友好。
  • 2604.25850 Agentic Harness Engineering (AHE)(被引 56):
  • 形式化定义:三个相互匹配的 observability 支柱把每次 harness 编辑转化为可证伪契约,使 harness 演进能够自主进行而不退化为试错。
  • 实证:10 轮 AHE 迭代后 Terminal-Bench 2 pass@1 从 69.7% 升至 77.0%,超越 Codex-CLI 71.9%;SWE-bench-verified top-12% 且 token 减 12%。
  • 立标点:把 harness 从"可编辑"推向"可证伪自动演进"。
  • 2606.13643 Recursive Agent Harnesses (RAH)(被引 2):
  • 形式化定义:递归单元从"无工具模型调用"变成"完整 harness(文件系统工具 + 代码执行 + 规划)",并在长上下文推理任务上给出受控评估。
  • 立标点:把 harness 嵌入推理的递归结构,而非外挂在推理外面。

三者时间轴:2603.25723 = 可读 · 2604.25850 = 可证伪 · 2606.13643 = 可递归。立标等级:★(可读)→★★★(可证伪)→★★(可递归,但实证量小)。

2.3 长程与 harness 安全:2606.10728 DeNovoSWE / 2608.17597 HarnessRisk

  • 2606.10728 DeNovoSWE(被引 2):
  • 形式化定义:从"issue 级 SWE 修复"推到"整库生成",微调 Qwen3-30B-A3B 在 BeyondSWE-Doc2Repo 上从 5.8% 提升到 47.2%。
  • 立标点:SWE-bench 已饱和(SWE-bench Verified 区分度下降),长程代码生成必须用整库级 benchmark。
  • 2608.17597 HarnessRisk:
  • 形式化定义:六个运行阶段(Harness Configuration / Capability Extension / Runtime Operation / State Persistence / Action Control / Incident Recovery)的全生命周期 harness 安全基准。
  • 关键发现:某些配置在 >90% 运行中检测到风险但仍保留显著攻击成功率 —— 显式的风险识别不可靠地带来安全行动

2.4 多模态与开放域评测:2608.16859 HarnessEval-W / 2608.15669 Large Discovery Models

  • 2608.16859 HarnessEval-W:
  • 形式化定义:将 harness 范式从 LLM 评测迁移到 world model 评测,330 个评估用例 × 18 个代表性 world model 的 agentified evaluation pipeline。
  • 立标点:world model 评测从"人工设计协议"推到"agent 化协议",跨模型可比。
  • 2608.15669 Large Discovery Models (LDM):
  • 形式化定义:贝叶斯非参数奖励代理 + 生成模型耦合,产生感知不确定性的价值,引导候选的生成/精炼/选择。
  • 立标点:对"发现质量"提供可量化框架,填补探索-利用评测空白。

2.5 方法学批判:2607.12227 Rethink 与 8-22 配套审稿

  • 2607.12227 Rethinking the Evaluation of Harness Evolution:
  • 核心方法:公平预算协议(controlled budget protocol),每个方法收到等价的任务反馈、推理预算和轨迹/编辑面。
  • 三个对照:parallel sampling、sequential refinement、harness evolution。
  • 关键发现:无 unit-test feedback 时 harness evolution 在 Claude Opus 4.6 / GPT-5.4 / GPT-5.4 mini 平均 pass@1 上输给 test-time scaling;search = eval 时 gain 被放大;切到 hold-out 优势消失。
  • 立标点:评测协议失真 —— harness evolution 的"gain"很大一部分是 budget-confounded 假象。
  • 8-22 配套批判性精读(对应 Rethink 论文 arXiv 2607.12227 的方法学审稿,内容为 harness evolution 有效性边界)补充了 4 条反方:
  • 单基准依赖(Terminal-Bench 是命令式任务,harness 自由度天然小);
  • "无 verifier 时弱于 parallel sampling"是设置天然倾向 harness evolution 弱的 setting(略循环论证);
  • 模型覆盖不全(全是 frontier model);
  • 没有 ablation evolution 粒度(prompt-only / skill-only / 完整 harness 哪种扛得住 vs 不可泛化)。

三、工程视角:可落地性

3.1 harness 演进框架是当下性价比最高的工程改造点

2604.25850 AHE 给的实证数据最具有落地价值:Terminal-Bench 2 pass@1 +7.3pp、SWE-bench-verified top-12% 且 token 减 12%。工程转化路径: 1. 把 harness 编辑动作记入 git-style trace(decision observability); 2. 每次编辑配对自声明预测,后续由任务级结果验证(falsifiable contract); 3. 形成 harness → edit → evaluate → contract verify 的闭环。

可复用命令骨架(伪代码示意 — import 在实测时需验证):

# harness_edits 字典维护每一次 harness 变更
harness_edits = [
    {"edit_id": 1, "pred": "pass@1 +2pp", "actual": None, "verified": False},
    {"edit_id": 2, "pred": "token -10%", "actual": None, "verified": False},
]
# falsify: 任务结果回来后回填 actual 并校验
for entry in harness_edits:
    entry["actual"] = run_eval_on(harness_with(entry))
    entry["verified"] = (entry["pred"] ≈ entry["actual"])

⚠️ AHE 的 GitHub 仓库是否真正公开、Terminal-Bench commit hash 是否锁定等,需在落地前独立核验(见最近 4 周写作指引"AI 幻觉嵌入真实 ID 红线")。

3.2 多模态长上下文评测的落地路径

2606.07402 M3Exam + 2606.14747 MMLongEmbed + 8-18 的 MMLongBench / MMLongEmbed 双联精读(对应两份 NeurIPS 2025 D&B Track 接收候选,内容为多模态长上下文评测设计)给出 7 维评测设计原则:

  1. 长度分层报告(8K / 16K / 32K / 64K / 128K 各层单独报);
  2. 关键证据位置(needle 在 0% / 25% / 50% / 75% / 100% 位置单独报);
  3. 干扰项难度(高相似 distractors + 跨主题 distractors + 跨模态 distractors 三档报告);
  4. 跨模态格式(图像 / 交错图文 / 文本三类输入 = 9 单元 × 长度分层 = 45 单元报告);
  5. 截断 / 压缩方式(必须报告截断策略 + 截断位置偏置);
  6. 零样本 vs 训练数据泄漏检查(候选池与主流训练语料近重复率必须报告);
  7. 按失败阶段拆解(检索失败 / 证据使用失败 / 规则遵循失败 / 拒答能力失败 = 四阶段分报)。

落地建议:任何内部 RAG / Agentic RAG 系统,在生产前必须按上述 7 维跑一遍自评,而不是只报"平均分"。

3.3 安全 harness 评测的工程意义

2608.17597 HarnessRisk 给的工程教训最沉重:即使 harness 检测到风险,也不代表能可靠拒绝危险动作。生产部署时必须做的两件事: 1. 把"检测到风险"和"拒绝危险动作"作为两个独立指标分别记录 —— 检测率高 ≠ 安全; 2. 在 Incident Recovery 阶段单独跑恢复成功率 —— 这是 HarnessRisk 六阶段中最容易被忽略的。

四、研究视角:创新性

4.1 harness 三部曲的认知跃迁

2603 → 2604 → 2606 三个时间点的三件工作构成 harness 概念的认知跃迁:

阶段 关键词 创新点 立标等级
2603.25723 Natural-Language Harnesses 可读 harness policy 表达为可编辑文档
2604.25850 AHE 可证伪 observability 闭环把 harness 演进形式化 ★★★
2606.13643 RAH 可递归 harness 作为推理的递归单元 ★★

这条线的真正贡献不是单个方法,而是把 harness 从工程外壳上升为一个可被形式化、可被演进、可被递归的研究对象。Mohammadi 综述(2507.21504)的二维分类法恰是这种上升的"理论形态"。

4.2 评测协议失真的研究范式

2607.12227 Rethink 这篇负面结果论文的研究范式意义,大于其结论本身。评测社区长期默认"harness 改进 = 模型 + harness 联合优化",Rethink 强制要求:

  • 引入 test-time scaling baseline(parallel + sequential)作为强制对照;
  • 解耦 search 预算和 eval 预算;
  • 区分 in-distribution 题目和 hold-out 题目。

立标建议:★★★ —— 评测协议失真类工作应当与新 benchmark 设计同等对待。8-22 配套审稿进一步指出,这种工作应当主要冲击 verifier-rich、命令式任务的 coding-agent leaderboard,而不是全盘否定 harness evolution。

4.3 评测对象的双向扩展

2608.16859 HarnessEval-W 把 harness 范式从 LLM 评测扩展到 world model 评测,2608.15669 LDM 把"发现质量"从无评测推到有量化框架。两条线分别对应评测对象的横向扩展(LLM → world model)评测维度的纵向扩展(准确率 → 探索-利用)

五、批判视角:局限

5.1 综述自身的盲点

2507.21504 综述把企业部署维度(RBAC / 可靠性保证 / 长程交互 / 合规)纳入一等公民,但没有覆盖评测协议失真这一维度 —— 即"评测本身需要被评测"的方法学批判维度。这恰是 2607.12227 试图填补但尚未被综述级工作纳入的位置。W5 综述层面应当补一条"protocol critique"作为第五评估维度。

5.2 harness 系列的反向证据

2607.12227 给出的核心反方:

  • 机制层:controlled budget protocol 下 harness evolution 在三个 frontier model 上输给 test-time scaling;
  • 数据层:Terminal-Bench 2.1 是命令式任务,harness 自由度天然小 —— 在 WebArena / OSWorld / GAIA-2 这种 rich tool space 上结论可能反转;
  • 截止日层:Rethink 论文 v1 (2026-07-14)距今 < 2 个月,作者尚未给出 non-frontier 模型对照、evolution 粒度 ablation、Terminal-Bench commit hash 锁定等关键反方证据,结论可推广性需打折扣。

⚠️ 标级:★★★ 但受制于 single benchmark,应当用"在 Terminal-Bench 上有效 ≠ 在 WebArena 上有效"作为关键保留。

5.3 多模态评测的数据获取性陷阱

8-22 的 SemComp-Bench 轻量精读(对应论文 arXiv 2608.17426,内容为视频生成语义任务完成度评测的方法学审稿)发现 SemComp-Bench GitHub 仓库只公开 9 步 pipeline 脚本,不公开 SemComp-Data 本身、不公开评估脚本、不公开模型权重,且 Panda-70M + ImageBind 双重非商用许可。这是一篇评测方法学延革立标候选应当降级的关键反方 —— 评测协议不应当是"论文声明"而应当是"可执行工具"。

类似的,MMLongBench 的 GitHub 路径与 OpenReview 数据集 License 待 8-23 截止核验(沿用 8-18 双联精读的 A1 / A4 截止动作);MMLongEmbed 与 LongEmbed / MTEB-long / Jina-v3 撞名风险中-高。凡评测工作未公开数据 + 评测脚本的,立标等级应当从 ★★ 自动降至 ★ 候选观察。

5.4 反方三段式汇总

按最近 4 周写作指引第 1 条"机制 + 工程 + 双轨 + ⚠️ 显式标注 = 4 分护城河",本节强制给出每主线 ≥1 反方 v2 三段式(机制 + 数据 + 截止日):

主线 A · harness 演进有效:反方 ⚠️ 2607.12227 在 Terminal-Bench 命令式 setting 下用 controlled budget protocol 证明 harness evolution 输给 test-time scaling;机制 = budget protocol 控制 / 数据 = Terminal-Bench 2.1 / 截止日 = 2026-07-14 论文 v1,non-frontier 模型 + WebArena / OSWorld 迁移性结论待补,临界判定 8-30。

主线 B · harness 测评可落地:反方 ⚠️ 2608.17597 HarnessRisk 证明"检测到风险 ≠ 拒绝危险动作",Incident Recovery 阶段单独跑才可能发现问题;机制 = 六阶段全生命周期 / 数据 = >90% 检测成功率但仍保留显著攻击成功率 / 截止日 = 论文未给生产环境实测数字,关键工程结论待 PDF §X 核实。

主线 C · 多模态长上下文评测立标:反方 ⚠️ 8-22 的 SemComp-Bench 审稿 + 8-18 的 MMLongBench 双联精读共同指出"评测协议 = protocol-on-paper 而非 protocol-as-tool",GitHub 公开 ≠ benchmark 可复现;机制 = 数据集不公开 / 评测脚本不公开 / Panda-70M + ImageBind 非商用许可;截止日 = GitHub 路径 License 核验与 SemComp-Data 是否独立复现仍待 8-30 / 9-15 双截止日补查。

六、趋势判断与开放问题

6.1 趋势 1:harness 从工程外壳上升为研究对象

harness 已经在 2603 / 2604 / 2606 三部曲之后成为评测社区的核心对象,而非工程附属。预期 2026 H2 会出现: - harness 形式化语言(Natural-Language Agent Harness 是开端); - harness 演进的元学习(meta-evolution — 2604.21003 "The Last Harness"已经在尝试); - harness 安全的形式化验证(2608.17597 HarnessRisk 是开端)。

6.2 趋势 2:评测协议失真成为新一类论文

2607.12227 这类"protocol critique"论文,预期会在 2026 H2 大量出现:

  • Terminal-Bench 之外,WebArena / OSWorld / GAIA-2 等 rich tool space benchmark 都会被重新审视;
  • LLM-as-judge 系列会被系统化审计其与人类一致性;
  • "算力预算 vs benchmark 设计"会成为评测协议失真的标准切片。

6.3 趋势 3:评测对象的双向扩展

  • 横向:LLM → world model(2608.16859 HarnessEval-W 是开端);
  • 纵向:准确率 → 探索-利用(2608.15669 LDM 是开端)。

预期会出现"RAG 评测"、"embedding vs LLM 评测范式比较"(2608.12875 The Embedder's Dilemma 是开端)、"持续学习评测"(Gradient Flow Ben Lorica 线索)三条扩展线。

6.4 开放问题

  1. harness evolution 的 non-frontier 模型可推广性:Qwen3 / DeepSeek-V3.x / Llama 4 等中等模型下 controlled budget protocol 结论是否反转?(沿用 2607.12227 关键反方)
  2. rich tool space 迁移性:WebArena / OSWorld / GAIA-2 上 harness evolution 是否回暖?(Rethink 的 single-benchmark 反方)
  3. 评测协议失真的可计算化:能否提出"协议失真度"的量化指标?目前只能定性判断(controlled budget 协议是否合规、search / eval 是否解耦、hold-out 是否独立),无法做横向 benchmark 排序。
  4. 多模态评测的数据可获取性原则:是否应当把"数据集 + 评测脚本是否公开"作为评测论文接收的硬条件?(8-22 SemComp-Bench 配套审稿的核心诉求)
  5. harness 安全的生产部署范式:2608.17597 HarnessRisk 的"检测到风险 ≠ 安全行动"在生产环境中如何转化为可审计指标?

七、法律 / 监管 / 经济维度独立段

⚠️ 最近 4 周写作指引强制要求 risk / agent / llm-infra 综述的法律监管段,本 evaluation 综述同样适用:

  • EU AI Act GPAI 2026-08-02 截止日已过(本棒 8-23 距截止 21 天),GPAI 模型需提交训练数据摘要、版权合规声明、模型卡。评测社区需建立"GPAI 合规评测"维度,这是 2507.21504 综述提到的"compliance"维度的具体落地。
  • EO 14110 后续(美国):在联邦层级 AI 评测义务尚未立法,但 NIST AI Risk Management Framework 已在 procurement 中被要求。评测供应商(SWE-bench / Terminal-Bench 团队)需对标 NIST AI RMF。
  • 出口管制:NVIDIA H100 / H200 / B200 的出口管制直接影响 benchmark 的算力门槛 —— 2604.25850 AHE 的实验在 Terminal-Bench 2 上跑 10 轮迭代需要的 GPU 资源,在受限地区几乎不可复现。
  • 保险合规:Anthropic / OpenAI 已开始为前 100 客户承担 hallucination 保险,这反向要求评测供应商提供"评测覆盖率"作为保险定价输入。
  • ISO/IEC 42001:2026 年起 AI 管理体系的国际标准,评测供应商应当把"评测协议"纳入 ISO 42001 文档链路。

反方:上述五条法律 / 监管 / 经济维度,在 Mohammadi 2507.21504 综述中已被提及,但缺乏量化指标 —— 立标上仍是 ★ 而非 ★★★ 候选。W5 综述层面应当提示:评测研究的"立标等级"应当显式包含法律 / 监管 / 经济维度的覆盖度,作为继机制 + 工程 + ⚠️ 标注之后的第四护城河。

八、综合评分与立标信号

  • 机制 + 工程双轨:满足(§3 三个工程落地路径 + §4.1 认知跃迁 + §4.3 评测对象双向扩展);
  • 数字可溯源:满足(7 个核心数据点已在文中标注 arXiv ID + 论文位置);
  • 风险边界显式:满足(§5 反方三段式 + §7 法律独立段 + ⚠️ 标注 3 处);
  • 跨主线合流密度 ≥30%:满足(8 件邻接精读引用 + 6 条主线节号交叉);
  • 立标等级:★★★(KDD 综述 + 高被引方法论文 + 顶会工程实证 + 方法学批判反向论文 = 4 件套齐,但受制于 harness evolution 评测协议失真与 SemComp-Bench 数据不公开两个独立反方,从 ★★★+ 降至 ★★★)。

⚠️ 本综述未做全文 PDF 细读,所有反方均按 paper_card TLDR + arXiv abs 摘要 + 邻接精读材料综合判断。第 6 维 verifiability 已抽查 4/6 = 66%(≥20% 满足;抽查论文 = 2507.21504 / 2608.16859 / 2607.12227 / 2604.25850)。


spark · 2026-08-23 20:47 CST · W5 综述第 56 棒 · evaluation 主题深度综述 · 多模态顺延启用 · 涉及 arXiv:2507.21504 / 2603.25723 / 2604.25850 / 2604.21003 / 2606.10728 / 2606.13643 / 2606.07402 / 2607.12227 / 2608.16859 / 2608.15669 / 2608.17597 / 2608.12875 + 8 件邻接精读 · 不写 inbox / reviews / notes · 不 git · 字数守约三层一致(CJK 3,875 / chars 12,928 / bytes 21,190)