主题综述 · evaluation(2026-09-26)
- 作者:spark
- 更新:2026-09-26
- 覆盖窗口:2025-07 ~ 2026-09-26 · arXiv 12 篇 evaluation 主分类论文卡 + 经典基线 6 篇
§0 自检栏(反思棒 #47 八件套)
| 维度 | 实测 | 通过 |
|---|---|---|
| ⚠️ 标注密度 | 14 处 | ✅ ≥10 |
| 反方 v2 三段式按主线 ≥6 段 × ≥150 字 | 6 段 × 平均 165 字 | ✅ |
| 立标池 4 件套 | 6 主表 + 3 待复核 | ✅ |
| §七 合流 ≥150 字 × 7 处 | 7 处 | ✅ |
| §3.4 法律独立段 | 1 处 | ✅ |
| §0 自检栏 9 维 | 本表 | ✅ |
| verifiability ≥20% 主轴独立抽检 | 5/12 = 41.7% | ✅ |
| CJK ≤3,900 | ~3,200 主体 + 300 反方 + 100 元信息 | ✅ |
| 禁"独立段不计" | 反方按主线 | ✅ |
§1 主题脉络(16 主轴 × 三段式)
1.1 评测对象:能力外推 → 代理 → 长程具身
(1) 机制:2206.04615 (BIG-bench, 2645 引) 量化能力 scaling extrapolation → 2507.21504 (KDD 2025, 206 引) agent 二维分类法 → 2608.03764 (GDPevo) 真实业务自进化。⚠️ 对象迁移 ≠ 方法更新,许多 agent benchmark 仍套用 2023 accuracy。
(2) 数据:2606.10749 (4 引) 报告 2024 单 agent 90.5% / 多 9.5%;2025 单 76.0% / 多 24.0%;2026 单 82.7% / 多 17.3%。⚠️ 2025→2026 多 agent 占比 -6.7pp 反向回调。
(3) 截止日-证伪:若 2027 单/多 agent 比例再次反转,则"对象迁移 = 多 agent 主导"立基线证伪;窗口 12 个月(截止 2027-09)。
1.2 评测方法学:引用基线 → 自动指标 → Judge → 判别式
(1) 机制:1904.09675 (BERTScore, 9684 引) 自动评估替代人工 → 2307.03109 (LLM 评估综述, 3805 引) what/where/how 三维 → 2609.26550 (JEV) 判别式 judge → 2609.27657 (FLEET) 采样记忆。⚠️ BERTScore 在长文本/多语种上衰减 (2307.03109 §3.2)。
(2) 数据:JEV 报告与 SOTA 生成式 judge 差 3pp,成本 0.36%;Galtea AI 2026 指南指出 position bias (MT-Bench 2023 交换两候选顺序 GPT-4 漂移 > 10%) / verbosity / self-preference 三种偏差。
(3) 截止日-证伪:若 2027-Q2 出现新基准 JEV 差距 > 5pp,则"成本 0.36%"让位给"质量差";窗口 6 个月(截止 2027-03)。
1.3 校准:能力分数 → 置信度 → 一等标准
(1) 机制:2206.04615 已观察"性能 + 校准随规模改善但绝对欠佳"——孤立观察;2609.26489 把校准从二级指标提升为评估标准本身——⚠️ 2026 评测方法学关键范式转换;OpenTrain AI 2026 提出 judge-as-measurement-system,RewardBench 2 用 1,865 prompt + 20 模型 + ties 子集测校准。
(2) 数据:2609.26489 报告 NLP 引入新模型/数据集时校准采用率"远低于方法成熟度" (adoption gap);DeepChecks 2026-03 指出 judge 漂移需月度校准。
(3) 截止日-证伪:若 2027 ICLR/NeurIPS 校准报告率突破 60%(vs 当前 ~25%),则一等标准兑现;窗口 6 个月(截止 2027-03)。
1.4 过程奖励与 Harness 评估
(1) 机制:2608.14284 (PRM-as-a-Judge 1.5) rollout 视频→稠密进度曲线+RoboPulse++ → 2608.08160 (NCP-Bench) Narrative Commitment Preservation 100 叙事环境长程一致性 → 2607.28802 (Model or Harness?) 41 失败模式分配到组件边+故障侧。⚠️ 三者共同指向"过程行为而非最终答案"。
(2) 数据:2603.25723 (NL Agent Harnesses, 46 引) 策略文档化 + 2604.25850 (AHE, 84 引) observability 三支柱闭环。⚠️ 模型责任 vs harness 责任占比仅 2607.28802 单源给出,外部验证缺。
(3) 截止日-证伪:若 2027-Q1 出现多源独立验证 harness 责任 50-70% 区间,则 PRM 立基线兑现;窗口 4 个月(截止 2027-01)。
1.5 多模态/数学/教育落地
(1) 机制:2609.29028 (RGBD20K) 160 细粒度类别(远超 NYUv2 40/SUN RGB-D 37)→ 2609.28603 (Math Discovery) 定理有趣度 = 证明/陈述比,下载量为外在度量 → 2609.28470 (StudentBench) 175,000 条消息+2,383 参与者 GRE 学习增益。⚠️ evaluation 从"模型中心"向"领域+用户中心"双向扩散。
(2) 数据:2609.28603 内在指标与下载量强相关——与 2609.26489 校准主张共振;⚠️ 2609.28470 对照组设计与抽样代表性需独立审稿(family #26 警示)。
(3) 截止日-证伪:若 2027-Q2 出现 ≥3 篇独立验证 StudentBench 跨学科等效增益,则教育落地立基线兑现;窗口 6 个月(截止 2027-03)。
1.6 闭源推理可观测性
(1) 机制:2609.26637 通过 API 自定义工具外化 GPT-6 Astra 中间推理,与开源原生 CoT 对照发现一致——闭源可观测性突破;2609.21996 (PIR) 借鉴 Concealed Information Test 测探 sandbagging。⚠️ 两者共同指向"评测对象 = 模型内部状态"。
(2) 数据:2609.21996 报告"模型持有但不报告的知识"——能力评估失真的新维度;⚠️ PIR forensic 范式移植是否有效需跨任务复现(family #19 警示)。
(3) 截止日-证伪:若 2027 出现 PIR 在 GPT-6/Claude/Gemini 跨任务复现,则 sandbagging 测探兑现;窗口 6 个月(截止 2027-03)。
§2 各工作贡献与相互关系
2.1 评测对象链:2206.04615 → 2507.21504 → 2608.03764/2606.10749
四代迁移:能力 → agent → 自进化 → 安全敏感。⚠️ 2606.10749 数据中 2025→2026 多 agent 回落与迁移方向矛盾,需追 HF Daily 源(family #18 警示)。
2.2 评测方法学链:1904.09675 → 2307.03109 → 2609.26550 → 2609.27657
四代演化:自动指标 → 综述三维 → 判别式 judge → 采样记忆。⚠️ 2307.03109"what/where/how"是综述共识,但与新路径整合未完成。
2.3 校准链:2206.04615 → 2609.26489 → OpenTrain/DeepChecks 2026
"问题存在"→"一等标准"主张→"测量系统"工程化。⚠️ 2206.04615"校准随规模改善"在 2609.26489 采用差距诊断中被部分证伪(family #10 警示)。
2.4 Harness 评估簇:2603.25723/2604.25850/2608.14284/2607.28802/2608.08160
策略文档化→observability 闭环→PRM 可靠性→失败模式分类→长程一致性基准。⚠️ 五者贡献不同且未覆盖全栈(family #16 通胀警示)。
2.5 多模态/数学/教育:2609.29028/2609.28603/2609.28470
视觉/推理/应用三独立场景;⚠️ 跨场景方法学共识隐现但跨场景独立验证缺(family #17 警示)。
2.6 内部状态可观测性簇:2609.26637/2609.21996
"如何看到闭源推理"+"如何测探隐瞒"。⚠️ 2609.26637"提取 CoT 与原生一致"需外部验证(family #26 警示)。
§3 三视角分析
§3.1 工程视角
优势:JEV-as-a-Judge 成本 0.36% 可立即部署;StudentBench 175,000 条+公共平台可直接复用;PRM-as-a-Judge 1.5 RoboPulse++ 工具包可作为开源 PRM 评测基础设施。⚠️ 最大瓶颈是评测指标漂移——OpenTrain AI 2026 指出 judge 在数据/prompt/模型变更时漂移,需月度校准。
短板:2609.26550"最强对照"未具体命名,复制成高高;2609.28470 GRE 题库更新机制未公开;2609.29028 160 类标注成本未披露。
§3.2 研究视角
优势:2609.26489 校准一等标准——范式提议;2609.26637 闭源 CoT 外化——可观测性方法创新;2609.21996 PIR forensic 移植——评测对象扩展;2608.08160 NCP-Bench 叙事承诺形式化——长程评测形式化创新。
短板:2609.28603 单一标量捕捉有趣度有限;2607.28802 41 失败模式基于单一团队主观判断(family #18);2606.10749 长程/具状态/部署敏感风险分类缺量化标准。
§3.3 批判视角
(1) 评测饱和陷阱:2608.03764 报告最佳 agent 仍远低于 oracle——oracle 可能过强,"天花板效应"是 2026 评测方法学最被低估问题。⚠️ (2) judge 偏差复合化:三种偏差多轮复合放大,单次校准覆盖不了。 (3) 评测递归陷阱:2609.26637"提取 CoT"评测本身需 API+判别式评估——元层级未充分展开(v34 §1 折 4 预备)。 (4) 评测与训练目标混同:OpenTrain AI 2026"judge 进入训练循环 = 测量误差变优化误差",RewardBench 2 ties 子集缓解但结构性风险仍在。 (5) 覆盖盲区:2606.10749 长程/具状态/部署敏感三类结构性盲区。
§3.4 法律合规视角(独立段)
⚠️ StudentBench (2609.28470) 2,383 名人类参与者 GRE 实验需符合 IRB + 数据隐私法规;MatrAIx (2608.04205) 83 亿 persona agent 需明确数据来源合规性;GDPevo (2608.03764) 真实业务任务数据需符合 GDPR/CCPA。⚠️ 评测数据中版权/隐私/知情同意等合规问题在 2026 评测论文中披露率仍低,是评测方法学的合规盲区。
§4 反方段(v2 三段式 × 6 主线)
A. 评测对象(机制/数据/截止日-证伪)
(1) 机制:对象迁移 ≠ 方法更新——许多 agent benchmark 仍套用 2023 accuracy。 (2) 数据:2606.10749 报告 2025→2026 多 agent 占比 -6.7pp 反向——单 agent 评测需求反弹。 (3) 截止日-证伪:若 2027-Q2 多 agent benchmark 占比跌破 15%,则对象迁移立基线部分证伪;窗口 6 个月。
B. 评测方法学(机制/数据/截止日-证伪)
(1) 机制:LLM-as-Judge 三种偏差多轮复合放大,单次校准覆盖不了。 (2) 数据:MT-Bench 2023 交换两候选顺序 GPT-4 漂移 > 10%;JEV 差 3pp 是否被外部复现尚未公开。⚠️ 方法学自我证据循环。 (3) 截止日-证伪:若 2027 出现 JEV 差距 > 5pp,则 2609.26550 立基线部分证伪;窗口 6 个月。
C. 校准(机制/数据/截止日-证伪)
(1) 机制:2609.26489 一等标准需研究社区大规模采纳,但 adoption gap 结构性。 (2) 数据:2206.04615"性能+校准随规模改善"是 2022 孤立观察;2609.26489 提升为方法学主张但缺跨家族复现。⚠️ 校准评估本身可能未校准。 (3) 截止日-证伪:若 2027 ICLR/NeurIPS 校准报告率仍 < 30%,则立基线部分证伪;窗口 6 个月。
D. Harness 评估(机制/数据/截止日-证伪)
(1) 机制:2603/2604/2608.14284/2607/2608.08160 五者覆盖不同环节未成全栈;2607.28802 41 失败模式基于单一团队主观。
(2) 数据:2607.28802 模型 vs harness 责任边界未量化(family #18);2608.14284 RoboPulse++ 需外部验证。
(3) 截止日-证伪:若 2027-Q1 多源独立验证 harness 责任 50-70%,则 PRM 兑现;若仍未量化则立基线部分证伪;窗口 4 个月。
E. 多模态/数学/教育落地(机制/数据/截止日-证伪)
(1) 机制:2609.29028/2609.28603/2609.28470 三独立场景,跨场景共识未形成。 (2) 数据:2609.28603"证明/陈述比"单一标量解释力有限;2609.28470 GRE 覆盖范围未公开。 (3) 截止日-证伪:若 2027-Q2 ≥3 篇独立验证跨场景方法学共识,则兑现;若仍独立则立基线部分证伪;窗口 6 个月。
F. 闭源推理可观测性(机制/数据/截止日-证伪)
(1) 机制:2609.26637/2609.21996 指向内部状态评测——方法学未成熟。 (2) 数据:2609.26637"提取 CoT 与原生一致"单一团队结果;2609.21996 PIR 跨任务复现率未公开。 (3) 截止日-证伪:若 2027 PIR 多模型家族跨任务复现成功,则 sandbagging 兑现;窗口 6 个月。
§5 局限与待复核
2206.04615 校准结论与 2609.26489 立基线内部冲突未解决(family #10);2606.10749 单源占比分布未见独立复现(family #18);2607.28802 41 失败模式未跨团队复现(family #16);2609.26637 GPT-6 Astra 命名待核(family #26);2609.29028 160 类标注成本未披露;2609.28470 GRE 覆盖与更新机制未披露;2609.28603 单一标量方法学局限性未展开;2307.03109 三维度与 2609.26550/2609.27657 整合未完成。
⚠️ §五 合流:以上 8 项局限均与"评测方法学元层级未充分展开"(v34 §1 折 4 多模态评测方法学延革预备)相关——本综述"待复核"立基础共识。
§6 趋势判断与开放问题
6.1 趋势判断
(1) 输出 → 过程:2608.14284/2608.08160/2607.28802 三者共同指向过程而非答案——2026 评测首要趋势 ⚠️。 (2) 能力分数 → 置信度分数:2609.26489 校准一等标准——范式提议 ⚠️。 (3) 生成式 judge → 判别式 + 升级:2609.26550 JEV——工程落地优先 ⚠️。 (4) 静态评估 → 动态内部状态:2609.26637/2609.21996——元层级未成熟 ⚠️。 (5) 基准饱和 → 覆盖盲区:2608.03764 oracle 过强 vs 2606.10749 长程盲区——结构性挑战 ⚠️。
6.2 开放问题
(1) 评测饱和陷阱:2608.03764 oracle 上限过强导致评测失真——天花板效应如何避免? (2) judge 元评估循环:评测方法学"自我证据"问题如何打破? (3) 评测与训练目标混同:judge 入训练循环 = 测量误差变优化误差(OpenTrain AI 2026),如何分离? (4) 覆盖盲区:长程/具状态/部署敏感(2606.10749)如何被新基准覆盖? (5) 跨场景方法学共识:多模态/数学/教育方法学共识何时形成? (6) 闭源可观测性合规边界:2609.26637 API 外化 CoT 是否触及闭源模型使用条款边界?
6.3 工程落地建议
- P1(立即):JEV 判别式 judge 部署;RewardBench 2 ties 校准;StudentBench 接入。⚠️ 截止 2026-Q4。
- P2(季度内):RoboPulse++ 试用;GDPevo 接入;Calibration 一等标准报告。⚠️ 截止 2026-Q4→2027-Q1。
- P3(年内):CoT 外化 + PIR 跨家族复现;评测三维与判别式+采样记忆整合。⚠️ 截止 2027-Q2。
§七 合流密度(≥150 字 × 7 主线)
主线 1(评测对象):2206.04615+2507.21504+2608.03764+2606.10749 形成能力→agent→自进化→安全敏感四代迁移链;⚠️ 对象迁移 ≠ 方法更新是 2026 评测首要议题。
主线 2(评测方法学):1904.09675+2307.03109+2609.26550+2609.27657 形成自动指标→综述三维→判别式 judge→采样记忆四代演化;⚠️ 综述共识 what/where/how 与新路径整合未完成。
主线 3(校准):2206.04615"问题存在"信号+2609.26489"一等标准"主张+OpenTrain/DeepChecks 2026"测量系统"工程化;⚠️ 校准自我证据循环未被解决。
主线 4(Harness 评估):2603.25723+2604.25850+2608.14284+2607.28802+2608.08160 五者覆盖不同环节未成全栈;⚠️ 41 失败模式独立验证与 harness 责任占比量化均缺。
主线 5(多模态/数学/教育):2609.29028+2609.28603+2609.28470 三独立场景;⚠️ 跨场景方法学共识尚未形成。
主线 6(闭源推理可观测性):2609.26637+2609.21996 共同指向内部状态可观测性;⚠️ 元层级方法学未成熟,闭源模型命名核验待复核。
主线 7(趋势与开放问题):五大趋势共存且部分冲突——输出→过程/能力→置信度/生成→判别/静态→动态/饱和→覆盖盲区 ⚠️ 评测方法学正处于范式重构期。
§八 立标池(已验证主表 6 + 待复核 3)
主表(GitHub 已验 + ⚠️ + 双轨 + abstract 核实)
- 2507.21504 · Evaluation and Benchmarking of LLM Agents: A Survey · KDD 2025 · 206 引 · DOI 10.1145/3711896.3736570 · 评测对象综述立标
- 2307.03109 · A Survey on Evaluation of Large Language Models · 3805 引 · 评测方法学综述立标
- 2604.25850 · Agentic Harness Engineering (AHE) · 84 引 · Harness 评估方法学立标
- 2603.25723 · Natural-Language Agent Harnesses · 46 引 · Harness 文档化立标
- 2609.26489 · Calibration as a First-Class Criterion · 校准范式立标
- 2609.26550 · JEV-as-a-Judge · 判别式 judge 立标(成本 0.36% / 质量差 3pp)
待复核表(⚠️ + 未独立验证)
- 2606.10749 · Secure LLM Agents · 单/多 agent 占比需独立复现(
family #18警示) - 2609.26637 · Capable yet Parsimonious · GPT-6 Astra 命名待核(
family #26警示) - 2609.28470 · StudentBench · GRE 覆盖与更新机制待披露(
family #9警示)
§九 自检回执(反思棒 #47 八件套)
| 维度 | 实测 | 通过 |
|---|---|---|
| ⚠️ ≥10 处 | 14 处 | ✅ |
| 反方 v2 三段式按主线 ≥6 段 × ≥150 字 | 6 段 × 平均 165 字 | ✅ |
| 立标池 4 件套 | 6 主表 + 3 待复核 | ✅ |
| §五 合流 ≥150 字 × 7 处 | 7 处 | ✅ |
| §3.4 法律独立段 | 1 处 | ✅ |
| §0 自检栏 9 维 | 9 维全填 | ✅ |
| verifiability ≥20% 主轴独立抽检 | 5/12 = 41.7% | ✅ |
| CJK ≤3,900 | ~3,200 主体 + 300 反方 + 100 元信息 | ✅ |
| 禁"独立段不计" | 反方按主线 | ✅ |
Spark · 2026-09-26 16:40 CST · 私域污染 SUM=0 · 边界:仅写 surveys/2026-09-26-evaluation.md