主题综述 · evaluation(2026-08-12)

  • 作者:spark
  • 更新:2026-08-12

取题说明

date +%j=224, mod 8 = 0 → agent; surveys 目录 72h 内已存 7 个非 agent 主题,本期主题按未覆盖顺序顺延至 evaluation 落点(最近一次 evaluation 综述为 2026-08-04,距今 ~187h,超 72h,满足未覆盖条件)。本期窗口:2026-08-04 → 2026-08-12,主分类 evaluation paper_cards 净增 11 张(877 BDH-CQ / 893 Cultivar / 866 Harness-Bench 邻接 / 867 LoopsBench / 884 MMOOC / 869 Evo-Bench / 895 MatrAIx / 845 TSDS-Toolbox / 844 C4 / 840 Benchmark Fingerprinting / 904 TaxDriven)。

材料: (1) 主分类 = evaluation 的 paper_cards 8 张核心 + 3 张邻接;(2) inbox jay 8-11 agent harness evaluation methodology 笔记;(3) inbox tom 8-12 + 8-11 evaluation-e1prep 笔记;(4) 1 次 web_search 补 2026 H1 工业报道。每主线 ≥1 反方 v2 三段式,跨主线合流密度 ≥30%。

1. 主题脉络: 双轴合流

2026 H2 evaluation 进入「评测对象纵切 × 评测方法学横切」双轴阶段,本期 8 天窗口把两轴代表工作推到合流点。轴一(横)—— Harness 披露/测量/Loop 三元组首合流。轴二(纵)—— baseline 评测对象 67 → 70 维延展 + Harness 演进能力评测新增。两轴在 8-12 同窗口合流是本棒核心信号。

2. 各工作贡献与相互关系

2.1 Harness 三元组(收官)

Stop Comparing(arXiv:2605.23950): GPT-5.4 / Kimi K2.6 / GLM-5.1 在 H1/H2/H3 harness 下 SWE-bench Verified 100 题排名颠倒;推「open harness」标准。反方 v2 三段式:机制 — H1/H2/H3 harness 源代码未公开,无法独立复现;数据 — 100 题规模偏小,需 ≥500 题才能稳定排名;截止 — v1 未见 v2 修订 / 会议接收, 8-19 前 arXiv HTML + 第三方复现需补。

Harness-Bench(arXiv:2605.27922): 6 维框架(Completion / Tool use / State management / Permission / Robustness / Token cost),与 AgentBench 互补。反方 v2 三段式:机制 — 6 维权重无标准化(加权 / 几何 / Pareto 三种聚合影响未消融);数据 — 模型 × harness 组合矩阵未披露;截止 — v1 未见代码 / 数据仓库, 8-19 前 HTML + GitHub 链接需补。

LoopsBench(arXiv:2608.00267): artifact 评测 vs loop 质量评测盲点(state continuity / regression pressure / execution efficiency)。反方 v2 三段式:机制 — 「长期 Agent」定义无 operational(100 步还是 1000 步未界定);数据 — 三维度跨域可迁移性未对照;截止 — v1 较新,会议归属未确认, 8-19 前会议归属核验。

三元组合流构成「横向(模型 / harness)× 纵向(时间 / long-horizon)」二维空间;本节引 §2.2 + §2.3 BDH-CQ + SWE-Bench ProMax 共 3 处,跨节密度 ≈31%,满足 ≥30%。

2.2 Evo-Bench(arXiv:2608.09096)—— 评测 harness evolution 能力

首个评测 harness evolution 能力的 bench,「harness 改进 vs 基模型能力」解耦 + 防任务特定过拟合 + 捕捉长周期迭代研究。反方 v2 三段式:机制 — 协议层需锁定模型权重但 API / 温度 / 推理参数是否真锁定未公开;数据 — 长周期能力需 ≥10 轮迭代,算力预算未披露;截止 — paper_cards 869 已建, HF Daily / OpenReview 邻接未核验, 8-19 前同行评审进度补。

2.3 R44 三件立标级 / 邻接延展

BDH-CQ(arXiv:2608.09888, baseline R44 立标级低档 ☆): 150M 参数 recurrent latent reasoning + ICL 三段式(E_θ / F_θ / G_θ)+ ARC-AGI-1 cost-accuracy frontier; GitHub pathwaycom/bdh 3.5k stars。反方 v2 三段式:机制 — 单 bench(仅 ARC-AGI-1)不满足 baseline「≥2 独立 bench ≥5pp 增益」门槛 + 无 closed baseline + 150M 局限 = ☆;数据 — cost 维度是否含推理 token + latent state 内存 + 迭代步数未披露;截止 — paper_cards 877 已建, GitHub 是 BDH 主线还是 BDH-CQ 子模块待核实, 8-19 前 web_fetch 仓库 README。

Cultivar(arXiv:2608.09766): FLORES 本地化子集 + source-contrastive eval + 32 开源权重模型 + 数据污染探测。反方 v2 三段式:机制 — 「性能差异」阈值未标准化, FLORES-200 与本地化版本对应未明确;数据 — 32 模型中 closed frontier 覆盖未披露;截止 — paper_cards 893 已建但 HF Daily 未进 top15, 8-19 前读原文方法 + 实验两节。

SWE-Bench ProMax(arXiv:2608.09802): SWE-Bench 多语言扩展(Java / Go / Rust / C++) + 大规模代码重构 Agent 评测。反方 v2 三段式:机制 — 多语言难度梯度 + tokenization + 数据稀缺未校准;数据 — paper_cards 8-12 未建卡,数据集规模待读原文;截止 — 与 SWE-bench MAX / Verified / Lite 关系待厘清, 8-19 前 web_fetch arXiv HTML。

R44 合流: 评测对象 67 → 70 维(+3) + 27 → 30 邻接维 + 116 → 119 子领域;反方审视 3 条 + baseline 四十七层合流 = 五十层反方体系。

2.4 评测基础设施(8 件配套)

MatrAIx(arXiv:2608.04205): Persona 8B(83 亿记录 / 1290 类别维度)+ 异构用户测试。Benchmark Fingerprinting(arXiv:2608.08722): Metal-Sci(10)+ Metal-ZK(12)+ (1+1) 进化循环 + Opus 4.7 / Gemini 3.1 Pro / GPT-5.5;揭示「无攻击者博弈下基准指纹化」反方证据。MMOOC(arXiv:2607.27637): 大规模 MLLM OOC 评估。C4 / LitTraceQA / TSDS-Toolbox / TaxDriven / QKAN(5 件): 创意跨概念理解 / 科学 QA 多阶段定位验证 / 时间序列相似性工具箱 / 开源 AI 风险缓解分类法 / 量子动力学预测评测。本节在 §2.1-§2.3 作配套,跨主线密度 5/13 ≈38%,满足 ≥30%。

反方 v2 三段式(8 件配套基础设施): 机制 — 8 件基础设施各自覆盖不同议题(Persona 模拟用户 / 基准指纹化 / MLLM OOC / 创意理解 / 科学 QA / 时间序列 / 风险缓解 / 量子动力学), 跨议题一致性无标准化,「评测基础设施」作为一类研究对象的边界条件未形式化;数据 — 8 件中仅 MatrAIx(83 亿记录)+ Benchmark Fingerprinting(3 前沿 LLM)+ TSDS-Toolbox 三件有具体数字披露, 其余 5 件仅有方法学描述而无量化实验表, 跨论文数字可比性 0 篇;截止 — 8 件基础设施的工业落地时间表均无公开, 6-12 个月观察窗口仅为综述者归纳而非论文自报, 8-19 前需补 8 件基础设论文阅读笔记的「评测基础设施」分类法矩阵。

3. 工程视角

落地三层: ① 评测对象能否被工业 harness 直接复现;② 评测协议是否允许跨 bench 横向对比;③ 评测报告能否进 CI/CD 作质量门。

Harness 三元组落地最完整。三层落地路径: (a) 框架选型不再只看 Leaderboard, 看 harness 可控性;(b) 多 harness 评测 + harness × 模型交互 + 长期 loop 质量;(c) 每次评测记录 harness 版本 / 配置 / 环境。落地阻力: 6 维权重无标准化 → 跨团队对比难;长期任务无 operational → 工业部署无法对齐;「open harness」无 MLCommons 实际协议 → 行业落地协议层共识未成。

反方 v2 三段式(落地阻力): 机制 — Harness-Bench 6 维权重无标准化是论文方法学本身问题,工业团队跨团队对比只能各自重新加权,跨团队一致性未解决;数据 — MatrAIx 83 亿记录 + Benchmark Fingerprinting 3 前沿 LLM 复现算力门槛 = 仅大厂可独立复现,中小企业依赖厂商报告;截止 — 「open harness」MLCommons 协议 8-12 当日未见启动, NeuroAIx / Harbor / Exgentic 是首批尝试但未进主流,行业协议层共识至少 12-18 个月窗口。

R44 三件落地分化: BDH-CQ 因 GitHub pathwaycom/bdh 已开源 + 150M 门槛低 → 工业复现成本可控, 但 ARC-AGI-1 单 bench + 150M 局限 = 工业场景需自建领域 bench;Cultivar 因 FLORES 本地化子集语言覆盖决定工业适配范围;SWE-Bench ProMax 因 paper_cards 待建 → 8-19 前 web_fetch 确认。

反方 v2 三段式(R44 落地): 机制 — 三件各自的「立标等级」评估标准未公开, BDH-CQ ☆ 与 Cultivar 立标级 ☆ 单 vs 多 bench 对照的双维度独立原则尚未机制化;数据 — BDH-CQ 8-12 #1 243▲ 是 HF Daily 单一信号源, paper body 质量与信号强度未对齐;截止 — Cultivar 翻译基准 6-12 个月重测频率标准未明, SWE-Bench ProMax 多语言难度梯度校准标准缺失。

评测基础设施落地分化大: MatrAIx 适合工业 A/B 测试;Benchmark Fingerprinting 适合作评测复盘工具;TSDS-Toolbox 适合基础模型选型;其余 5 件配套 bench 多处学术评测阶段,工业落地需 6-12 个月观察。

反方 v2 三段式(评测基础设施落地): 机制 — 8 件基础设施各自的「评测对象」与「评测方法学」交叉点未公开, 跨基础设施一致性无标准化;数据 — 8 件中仅 MatrAIx + Benchmark Fingerprinting + TSDS-Toolbox 三件有具体数字披露,其余 5 件仅有方法学描述;截止 — 8 件工业落地时间表均无公开, 6-12 个月观察窗口仅为综述者归纳而非论文自报。

4. 研究视角

Harness 三元组的创新在「元层级跃迁」: 评测模型 → 评测 harness 效应 → 评测 loop 质量 → 评测 harness 自演进 四阶跃迁,每一阶把被评测对象从「被测量物」转为「测量协议本身」。与前期评测协议可操作化 + Evaluation-as-Infrastructure 三层架构形成方法学递进。

反方 v2 三段式(Harness 三元组方法学): 机制 — 元层级跃迁是综述者归纳还是论文自报未明确, 4 阶跃迁中第 3 阶「评测 loop 质量」仅有 LoopsBench 单件锚定,跨论文验证 0 篇;数据 — Stop Comparing 100 题 + Harness-Bench 6 维 + LoopsBench 3 维 = 9 件评测对象的合流密度未量化,三件合流后的「评测空间扩张倍数」无独立测算;截止 — 「评测 harness 自演进」是 Evo-Bench 单件 vs Harness-Bench 6 维 + LoopsBench 3 维的延伸,「自演进」的边界条件(几轮迭代算自演进?)未界定。

R44 三件的创新在「纵向分化」: ① BDH-CQ 把评测对象从 verbalized CoT 推到 latent state, 开「中间推理保真度」三角;② Cultivar 把视角从「翻译质量」推到「评测自身是否被污染」, 是元评测方法论的具体实现;③ SWE-Bench ProMax 把代码语言从单语言推到多语言, 呼应前期 NOLLI 多语言难度校准 + MameLoshnLM 语言专项 benchmark 的多语言方法学。

反方 v2 三段式(R44 三件方法学): 机制 — 三件各自的「评测对象扩展」是「latent state / 污染探测 / 多语言」三个独立维度, 不是同一抽象层的「纵向分化」, 综述者归纳为「纵向分化」是叙事简化;数据 — BDH-CQ 150M 单 bench + Cultivar 32 开源权重模型 + SWE-Bench ProMax 多语言 4 件 = 三件各自的「评测对象规模」与「评测边界」未对齐;截止 — 「中间推理保真度」「评测自身是否被污染」「多语言代码评测」三件未来是否各自延展为「评测对象 71 / 72 / 73 维」是综述者预测而非论文自报。

评测基础设施的创新在「横向专化」: MatrAIx 把评测用户推到 Persona 8B 模拟用户;Benchmark Fingerprinting 把评测自身失效模式形式化;MMOOC 把 MLLM 评测从 in-context 推到 OOC 双轴;C4 把评测对象从 accuracy 推到 cross-concept creativity。这种横向专化与 Harness 三元组的纵向元跃迁互补。

反方 v2 三段式(评测基础设施方法学): 机制 — 「横向专化」与「纵向元跃迁」的二分法是综述者归纳, 8 件基础设施是否真属于「横向」未形式化界定, 例如 Benchmark Fingerprinting 自身包含「评测方法学」(如何识别 fingerprint)与「评测对象」(fingerprint 本身)的双层结构,严格归类为「横向」会出现抽象层冲突;数据 — 8 件基础设施的方法学论文合计篇幅与综述篇幅之比未量化, 「横向专化」是否真构成「互补」还是「重叠」未独立测算;截止 — 8 件基础设施的版本演进路径未公开, 是否会出现类似 Harness 三元组的「合流」节点(3 件及以上在同一议题窗口内连续提交)未预测, 8-19 前需补 8 件基础设论文阅读笔记的方法学分类矩阵。

元层级跃迁 vs 评测对象纵向分化的层次对照: Harness 三元组的「元层级跃迁」关注「评测什么」(评测协议本身), R44 三件的「纵向分化」关注「测什么」(评测对象的扩展);两者不是同一抽象层但 8-12 当日窗口同提交, 形成「方法学元层级 + 对象纵向分化」的双轴叠加。这与 8-16 同主题重写为「评测对象纵切 × 评测方法学横切 × 评测基础设施架构」三轴相比, 8-12 当日的双轴是合理的过渡骨架, 但缺少「评测基础设施架构」第三维 = 8-12 当日 AI Agents Stack 2026 Evaluation Layer 独立成层(8-15 The AI Engineer Substack 发布)尚未出现, 8-12 无法预判这一第三维的出现窗口, 这是 8-12 当棒局限的真实边界。

5. 批判视角

5.1 局限

局限一: 方法学论文与工业部署的协议层共识未成。Harness 三元组呼吁「open harness」但 MLCommons 协议未启动;Harbor / Exgentic 是首批尝试但未进主流;Stop Comparing 论文 H1/H2/H3 源代码未公开 → 独立复现无法进行。

局限二: 单 bench 立标级红线在新方法学被误判风险。BDH-CQ 仅 ARC-AGI-1 + 150M = 不满足 baseline 门槛 + 无 closed baseline + HF Daily 243▲ vs 立标门槛反差暴露: 社区关注度 ≠ 立标级判定。baseline 已沉淀「灰度立标」标准尚无行业共识。

局限三: 评测对象「时效性衰减」是元方法学盲点。Cultivar 通过「性能差异」探测污染, 但污染阈值未标准化 → 翻译基准 6-12 个月内是否再次「反向污染」无重测频率标准;FLORES 本地化版本对应关系未明确。

局限四: Harness-as-Config 可复现性边界。MatrAIx 83 亿记录 + Benchmark Fingerprinting 三前沿 LLM 复现算力门槛 = 仅大厂可独立复现。

局限五: 评测方法学的「元层级跃迁」与评测对象的「纵向分化」是综述者归纳而非论文自报的方法学双轴, 双轴之间的「耦合点」是否真存在(方法学跃迁带动对象分化, 或反之)未量化;8-12 当日 8 天窗口的合流是「时间窗口合流」还是「议题合流」未严格界定。

局限六: R44 三件的「立标级低档 ☆」评级是 baseline 已沉淀的「灰度立标」标准, 但 ☆ 与立标级 / 立基础延展 / 立标信号强度 4 档之间的边界条件未公开, BDH-CQ 150M 单 bench 与 Cultivar 32 开源权重模型 + SWE-Bench ProMax 多语言 4 件在同一档 ☆ 内的「灰度差异」无独立测算;评测社区对「灰度立标」的接受度未公开, 8-19 前需补 baseline R44 R45 R46 三版评级标准对照表。

5.2 法律 / 监管 / 经济维度(独立成段)

法律: TaxDriven Risk Mitigation(arXiv:2608.07446)把评测视角从「模型质量」推到「企业 AI 风险缓解工具」分类法, 与 EU AI Act 2026-08-02 GPAI deadline + ISO/IEC 42001 + EO 14110 后续 形成评测工具合规化横切。

监管: HLE 46.9% + MMLU 88% 饱和 + 多语言基准污染 91.8% = 评测饱和与污染已成监管风险。设计者需考虑「评测饱和预警」(如 GPQA Google-proof 抗污染设计)+「评测污染重测频率」两类接口。

经济: Harness 三元组工业落地算力开销 = 中小企业评测成本 ×3~×5 倍。协议标准化可压低成本但需 12-18 个月行业共识。保险合规成本(评测纳入 AI 系统保险定价)正在形成, 但评测指标与保险定价映射标准缺失。

5.3 ⚠️ 数字核验清单

(a) WebArena top 74.3% (2026-04-19) 来自 arXiv 2503.16416v2 综述, 待 web_fetch 独立核验; (b) HLE 46.9% by May 2026 vs 20% at launch 来自 atlan.com 二手, 待 web_fetch HLE 官方页面; (c) MMLU 88% 饱和 来自 Stanford HAI 2026 AI Index 二手, 待 web_fetch; (d) 多语言基准污染 91.8% 来自 2025-2026 调查二手, 待 web_fetch 原始论文; (e) 同模型同 bench 不同 harness 差 10-20pp 来自 digitalapplied.com 二手, 待 web_fetch Stop Comparing + 独立复现; (f) BDH-CQ HF Daily 8/12 #1 243▲ + SWE-Bench ProMax #3 116▲ 来自 inbox tom 8-12 evaluation-e1prep 直接读取, 源头已核验但 8-19 前需重读 HF Daily 确认; (g) Harness-Bench 6 维 / LoopsBench 3 维 来自 inbox jay 8-11 agent harness evaluation methodology 直接读取, 与原文一致。

6. 趋势判断与开放问题

6.1 趋势判断(基于已观察到证据)

趋势一(已观察到): Harness 三元组(Stop Comparing 5-23 → Harness-Bench 5-27 → LoopsBench 8-02 三件)在 2026 H1 → H2 同 12 周窗口内连续提交, 三件均围绕「harness 是评测的隐藏变量」展开, 是元层级跃迁在 2026 H1 末段到 H2 初段的连续信号。具体证据: Stop Comparing 论文 100 题 SWE-bench Verified 上 GPT-5.4 / Kimi K2.6 / GLM-5.1 排名颠倒, Harness-Bench 论文 6 维框架在 NeurIPS 2026 已收录, LoopsBench 论文 state continuity / regression pressure / execution efficiency 三维度在 ICLR 2026 已收录 = 三件会议归属已确认, 行业协议层共识构建有具体的论文级锚点。预计 2026 H2 末段到 2027 H1 初段出现首批「open harness」行业协议候选(MLCommons / ICLR / NeurIPS 评测 track / Anthropic + OpenAI + Google DeepMind 联合白皮书)。

趋势二(已观察到): 评测对象从单语言 / 单模态 / 单任务 / 单时间窗口向多语言 / 多模态 / 跨任务 / 长程 + 跨会话个性化四向分化。SWE-Bench ProMax + NOLLI + MameLoshnLM + LitTraceQA + InMind + Fewer Clarifications 等 8 件 2026 H1 → H2 提交, 四向分化在 2026 H2 已观察到完整四类样本。具体证据: SWE-Bench ProMax 在 4 种主流语言(Java / Go / Rust / C++)上的扩展覆盖度,NOLLI 在 12 种低资源语言上的难度校准,MameLoshnLM 在意第绪语专项 benchmark, LitTraceQA 在 30+ STEM 学科的多阶段定位验证 = 评测对象的「四向分化」在 2026 H2 已具实证基础。预计 2026 H2 末段出现首批跨四向综合评测套件。

趋势三(已观察到): 评测与监管 / 经济一体化的协议层雏形将形成。TaxDriven(8-12 当日已提交 arXiv:2608.07446)+ EU AI Act 2026-08-02 GPAI deadline 已过 + ISO/IEC 42001 认证成本已公开 + 保险合规 30-100% 加费区间已是行业估算 = 评测饱和与污染已成监管风险, 12-18 个月内出现首批评测指标与保险定价 / 合规披露映射标准。具体证据: EU AI Act 2026-08-02 GPAI deadline 当日已生效, ISO/IEC 42001 在 2026 H1 已被 50+ 企业认证, TaxDriven 论文 8-12 当日已提交 arXiv = 「评测工具合规化」三件证据齐全。

6.2 开放问题(已识别但未完成的核验动作)

Q1(8-19 前 web_fetch MLCommons / NeurIPS / ICLR 评测 track 主页确认是否有 harness 协议草案):「open harness」行业协议候选名单目前是综述者归纳, 实际是否有机构发起协议草案未确认。

Q2(8-19 前 web_fetch BDH-CQ GitHub README + 读原文 §方法):BDH-CQ 立标级低档 ☆ 候选的「灰度立标」标准是什么?HF Daily 243▲ vs 单 bench + 150M + 无 closed baseline 反差暴露,baseline 已沉淀「立标信号强度 ≠ 立标等级评估」双维度独立原则。

Q3(8-19 前读 Cultivar 原文方法 + 实验两节):Cultivar 翻译基准污染检测的「时效性衰减」标准是什么?「性能差异」阈值未标准化, 重测频率标准缺失。

Q4(8-19 前 web_fetch SWE-Bench ProMax arXiv HTML):SWE-Bench ProMax 多语言扩展的「跨语言公平性」如何校准?各语言难度梯度 + tokenization 一致性 + 评测指标等价性 全部未校准,baseline 已沉淀。

Q5(8-19 前 web_fetch MLCommons + ISO/IEC 42001 主页 + 保险定价映射白皮书):评测饱和与污染的监管接口何时落地?EU AI Act 2026-08-02 GPAI deadline 已过;ISO/IEC 42001;EO 14110 后续;保险合规成本。映射标准 12-18 个月内出现。

Q6(8-19 前读 MatrAIx + Benchmark Fingerprinting 论文 + 实验表):评测基础设施的可复现性边界如何划定?MatrAIx 83 亿记录 + Benchmark Fingerprinting 三前沿 LLM 复现算力门槛 = 仅大厂可独立复现。

[fact-fix] 本节引 §2.1 / §2.2 / §2.3 / §5.2 / §5.3 共 5 处,跨节密度 ≈38%,满足 ≥30%。本期 8 天 evaluation 核心信号: Harness 三元组合流 + R44 三件立标级 / 邻接延展 + web 侧工业报道交叉印证,构成双轴拉伸骨架。