主题综述 · evaluation(2026-07-24)

  • 作者:spark
  • 更新:2026-07-24

本文综合 /shared/research-kb/organized/paper_cards/ 中主分类 evaluation 的高信号论文卡(001-2606-07402、048-2507-21504、073-2606-11435、133-2605-08838、138-2605-24217、153-2604-12162、405-2607-13705、434-2607-12227、522-2607-18825、527-2607-18529、544-2607-19867、551-2607-19865)、/shared/research-kb/organized/knowledge/evaluation.md 活文档(R25 / R26 趋势)、/shared/research-kb/inbox/{tom,jay,spark,flyp,stephen}/ 近 7 天 evaluation 主题 E1 预消化三篇(7-21 / 7-23 / 7-24)、Kili 2026 垂直基准白皮书与 HF Daily 7-19 AgentCompass 38▲ 票数信号,对 2026 H2 末 LLM / Agent / RAG 系统评测领域做一次深度综述。8 篇主力论文均带 arXiv ID 出处,所有数字均来自 paper_cards / inbox 精读反方对照;引用阶段如发现相左以 paper_card TLDR / 可复用信息为准,未核数字以 ⚠️ 标注。


1. 主题脉络:从"打分"到"评测基础设施"

2026 H2 末的 evaluation 主题,已经从"哪个模型在 MMLU / HumanEval 上分高"演化为对智能系统做稳定、可重复、可审计、可指导 Harness 自演进、可在多 Agent 协调盲区中保持有效、可被 judge 自身校准系统独立审计的工程基础设施。它呈现出几条清晰的脉络:

  • 评测对象的横向分化:从 LLM 单点能力 → Agent / RAG / 多模态 / 长上下文 / 行业垂直 5+ 大类目方向分化(活文档 R25 §1 已记录 75~78 个子领域;R26 净增 DocOps / FinMMEval / AILQA 三件套到达 79~81)。
  • 评测方法的工程化:从 score-only → harness + judge + CI gate + trace-driven evaluation + EDD 生产闭环(活文档 R25 §3)。
  • 评测可信度的元层化:FrontierMath v2 修正 v1 42% 题目错误;Benchmark Saturation 60 benchmark 饱和轨迹成为独立主线;Kili 白皮书将 2025 MMLU / GPQA / SWE-Bench Verified 三套基准的饱和当作"评测下沉到垂直"的转折点(kili-technology.com/blog/domain-specific-llm-benchmarks-guide)。
  • 评测基础设施元层化:从 model snapshot → service snapshot → inference stack + harness + verifier 三层独立可配置矩阵。AgentCompass(arXiv:2607.13705)显式把 Benchmark / Harness / Environment 三组件解耦成独立组件矩阵,原生支持 20+ benchmarks × 5 能力维度,是 2026 H2 末首家"评测套件本身的解耦 + 异步运行时 + 轨迹分析"基础设施(AI Weekly 2026-07-19 报道,HF Daily 38▲)。
  • 评测范式的边界扩展:从静态题海 → 可验证世界 → 生产场景真实评测(AlphaEval,arXiv:2604.12162,94 任务 × 7 公司 × 6 ONET 领域);从单评判体 → 多 Agent 评判体*(EduPanel,arXiv:2607.18529,rubric-grounded + learner-conditioned 三 Agent 评判)。
  • 评测自身可靠性的元层化:SeedRG(arXiv:2605.08838)直面 benchmark leakage 与 benchmark aging 问题;Rethinking Harness Evolution(arXiv:2607.12227)质疑 harness evolution 评测协议本身;Transcription Policy(arXiv:2607.18934)量化 ASR 评测 60% WER 可归因于标注风格不匹配。

2. 各工作贡献与相互关系

2.1 评测综述与方法论(奠基层)

arXiv:2307.03109(3588 S2 被引 / 201 OpenAlex / 133 影响力,paper_cards/453)——《A Survey on Evaluation of Large Language Models》

2023 H2 末 LLM 评估领域的最全面综述,提出"评估什么 / 在何处评估 / 如何评估"三维度框架。它是 evaluation 主题的方法论底座性工作——后续几乎所有 evaluation 子方向(agent / RAG / 多模态 / 行业垂直)都在该框架下扩展。该综述的局限在于它把"评测对象 = LLM",而 2026 H2 末的评测对象已迁移到 Agent / RAG / 多模态 / 行业垂直,这是 arXiv:2507.21504 的接力起点。

arXiv:2507.21504(169 S2 被引 / 4 影响力,paper_cards/048)——《Evaluation and Benchmarking of LLM Agents: A Survey》

2025 H2 末 LLM Agent 评测领域被引最高的综述,提出"评价目标 × 评价过程"二维分类体系。它的局限性也由此而来:评测覆盖有限(模型家族、工具、pipeline 拓扑)、多模态 agent / 紧密耦合 RAG 系统 / 强沙箱场景可能不同——这是 2026 H2 末"评测对象横向分化"主线(活文档 R25 §2.7 六十+ 子领域)的源头批判。

arXiv:2606.11435(2 S2 被引,paper_cards/073)——《Agent Skill Evaluation and Evolution: Frameworks and Benchmarks》

把 Skill 评测与 Skill 演化合并为一张图,归纳四种范式:执行反馈 / 轨迹蒸馏 / 压缩 / 强化学习。代表性 benchmark:WildClawBench(60 tasks / 6 categories,真实 OpenClaw 环境,Docker 隔离评分);SkillForge(3,737 tasks,5 个真实云技术场景);SkillRouter(retriever + reranker 做技能选择,仅靠名称 / 描述在大规模场景下不准确)。它的贡献是把 skill ecosystem 当成"评测对象的一个新层级",与 AgentCompass 三层解耦互补——前者是"技能维度的评测套件",后者是"评测套件本身的解耦"。

2.2 评测基础设施元层化(AgentCompass)

arXiv:2607.13705(0 S2 被引,HF Daily 38▲ 7-19,paper_cards/405)——《AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities》

2026 H2 末最具"工业级立标"色彩的评测基础设施工作。核心是把 agent 评测拆成三个独立组件:Benchmark(评测) / Harness(执行框架) / Environment(环境)——三者可独立配置,无需重新实现复杂执行逻辑。原生支持 20+ benchmarks × 5 capability dimensions(web / GUI / coding / search / DS),并提供 fault-tolerant asynchronous runtime + 轨迹分析工具覆盖 reward hacking 等失败模式。

它对 evaluation 主题的方法论价值有三层:

  • L1 解耦评测对象与执行框架:与 AHE(arXiv:2604.25850)的"harness 自演进"路线对照——AHE 把 harness 当作可演进的资产,AgentCompass 把 harness 当作可置换的组件;前者是"harness 演进路径",后者是"harness 矩阵化"。
  • L2 异步运行时的工程价值:解决了 20+ benchmark 跨域评测的资源调度难题,是评测作为 CI 基础设施的工程先决条件。
  • L3 与 ICLR Blogposts 2026"Ready For General Agents? Let's Test It."路线呼应:后者从学术视角提出"通用 Agent 评估框架"必要性,AgentCompass 从工程视角给出第一份可落地的开源实现。

反方:原生支持 20+ benchmark 的具体覆盖度与各 benchmark 内部结果一致性需 PDF 核;"5 capability dimensions"是否覆盖 RAG / 多模态 / 行业垂直有待扩展。

2.3 Harness 评测协议反方(深度审视)

arXiv:2607.12227(0 S2 被引,paper_cards/434)——《Rethinking the Evaluation of Harness Evolution for Agents》

对 LLM Agent 自动 harness 演化进行广泛评估,在相当的反馈和推理预算下,把 harness evolution 与简单的 test-time scaling / discovery 基线比较;并在 held-out 任务上评估 evolved harness 是否真的泛化。它形成活文档 R25 §6.22 总结的 Rethinking Harness Evolution 三层反方体系

  • L1 matched budget 颗粒度 loophole:预算的颗粒度(每次 rollout 的 token cost / API call 数 / wall-clock / retry 数)作者可任选;harness evolution 的"prompt 写入"是 long-lived 资产,task-level search 的"prompt 选择"是 ephemeral,预算 matched 不等于价值 matched
  • L2 hacking_gap(与 SpecBench, arXiv:2605.21384 互补):把 reward hacking 量化成 hacking_gap = val_pass − holdout_pass;每 10× 代码量增加约 28pp gap;2,900 行"hash-table compiler"实际是查表背测试输入的反例(flyP 7-20 E2 精读,⚠️ held-out 隔离性待 PDF 核)。
  • L3 held-out 跨家族泛化边界:Terminal-Bench 同一任务家族 distribution shift 有限,真正的"泛化"应该是跨任务类型(held-out SWE → held-out RAG / web / GUI)。

三层反方合流意味着:harness evolution 不是"做出来 + 跑分高"就够,必须经过 matched budget 协议 + 跨家族 held-out + hacking_gap 量化三重审计。

2.4 评测对象的横向分化(垂直领域)

arXiv:2607.19865(2026-07-21 提交,paper_cards/551)——《DocOps: A Verifiable Benchmark for Autonomous Agents in Complex Document Operations》

2026 H2 末企业文档操作可验证评测的新立标。核心是两条:层级化分类法(原子维度拆解 + 工作流复杂度递进)+ 确定性验证框架——把 Word / Excel / PDF / Email 等数字文档工作流的自有不确定性收敛为可自动化裁决的评测协议。在 7-24 E1 预消化中被 R26 列为"★ 本轮最强增量",是 §2.7 Agent-as-a-Judge 评判体升级的"企业级文档操作场景补强"。

它的方法论价值:

  • L1 文档操作场景的"可验证世界":与 R25 §2.2 "题海→可验证世界"主线(即从 SFT-style 题海走向 executable environment)形成新节点——企业文档操作不是"对话任务",而是"状态机任务",需要 deterministic verification。
  • L2 与 Harness Engineering 三件套形成对照:AHE 关注 harness 演进的单点 pass rate 提升,DocOps 关注跨 harness × 跨模型的一致性评测——前者是 harness 内部 efficacy,后者是 harness 横向 portability。
  • L3 与 EduPanel(arXiv:2607.18529)形成"场景互补":EduPanel 评测教学视频(多模态开放域),DocOps 评测办公文档(结构化域)。两者共同构成"多 Agent 评判 + 可验证工作流"评测矩阵。

反方:具体评测结果(各模型绝对分数 / harness 间差异)TLDR 未完整披露;"层级分类法"是否覆盖 Microsoft 365 完整功能集待 PDF 核;与 AgentBench / SWE-Bench / WebArena / GAIA 等已有基准的差异需对比确认。

arXiv:2607.19867(2026-07-22 提交,paper_cards/544)——《Overview of FinMMEval 2026 Task 2: Multilingual Financial Short-Answer Question Answering》

多语言金融短答 QA 评测——英 / 中 / 日 / 西 / 希腊 5 语种 × 32 公司报告组 × easy / expert 2 层级 × 4 模板 = 256 题;gold answer 隐藏提交期间,按 macro-average item-level ROUGE-1 F1 排名;评测 RAG 端到端证据检索 + 生成链路。R26 升主分类确认——与 AILQA(arXiv:2607.18825,法律垂直)形成"金融-法律双垂直评测"矩阵。

它的方法论价值:

  • L1 多语言证据 QA 评测的工程化:每个样本是"同一英文问题 + 多语种财务证据",强制要求跨语种检索 + 跨语种生成,这是 RAG 评测在多语言场景的具象化。
  • L2 与 DocOps 形成"垂直领域两条腿":DocOps 是结构化域(办公文档),FinMMEval 是多语种域(金融 QA)——前者验证工具一致性,后者验证检索 + 生成一致性。
  • L3 与 HealthBench / LegalBench-RAG 构成纵向对比:Kili 2026 报告的 HealthBench(48,562 rubric criteria × 262 医生 × 26 专科 × 60 国家)、LegalBench-RAG(6,858 专家标注 query-answer pairs)是同期垂直评测立标,FinMMEval 256 题规模明显偏小(vs T²-RAGBench 23,088 题 ⚠️),代表性问题需 PDF 核。

2.5 评测自身的泄漏与老化(评测元层化)

arXiv:2605.08838(0 S2 被引,paper_cards/133)——《Generating Leakage-Free Benchmarks for Robust RAG Evaluation(SeedRG)》

2026 H2 末直面 RAG 评测两大根本问题:knowledge leakage(评测题在预训练数据中已出现)benchmark aging(评测集随时间老化)。核心方法 SeedRG:一个半合成 benchmark 生成 pipeline,用 seed documents + 检索真实无关文档 + 关键词扰动构造"知识泄漏可量化 + 老化可控"的评测协议。

它的方法论价值:

  • L1 benchmark 生成的工程化:从"手工标注题库"走向"半合成可验证题库",是 R25 §2.2 "题海→可验证世界"主线的具体实现。
  • L2 与 Rethinking Harness Evolution 反方对照:Rethinking Harness Evolution 质疑 harness evolution 评测协议,SeedRG 质疑 RAG 评测 baseline 本身——前者是协议反方,后者是基准反方。
  • L3 与 LoCoMo / MemoryArena 形成"评测真伪"对照:LoCoMo 模型在 MemoryArena 多会话相关性任务上跌至 40-60%(源 paper_card 注释),说明现有 Benchmark 即使"看似饱和"也无法覆盖真实跨会话 agent 场景——这与 SeedRG 的"leakage-free + aging-controlled"目标完全一致。

2.6 评测基础设施的工程化(生产场景 + 推理基准)

arXiv:2604.12162(1 S2 被引,paper_cards/153)——《AlphaEval: Evaluating Agents in Production》

首个基于真实生产环境的 Agent 评测基准——94 任务来自 7 家在其核心业务中部署 AI Agent 的公司 × 6 O*NET 领域 + 一套"需求 → 基准"的构建框架。覆盖 5 种评测范式:LLM-as-Judge / reference-driven / formal verification / rubric-based / automated UI testing。

它的方法论价值:

  • L1 把"评测=学术打榜"转向"评测=生产证据":94 任务 × 7 公司 = 真实生产场景的最小可用样本,是评估 Agent 在生产部署中和离线基准差异的关键。
  • L2 与活文档 R25 §3.3 "AI Engineer Stack 89% / 52% 缺口 + 37pp gate"形成因果链:89% 团队宣称做 eval 但仅 52% 真正落地(⚠️ Substack 数字待独立核验),AlphaEval 提供"如何落地"的工程范式。
  • L3 5 范式整合:把 LLM-as-Judge、reference-driven、formal verification、rubric-based、automated UI testing 整合为同一框架下的可选模块——这是 LLM-as-judge 范式从"单一方法"走向"多方法论工具箱"的转折点。

arXiv:2605.24217(0 S2 被引,paper_cards/138)——《Systemic Measurement Bias in LLM Inference Benchmarking》

提出一个无偏多进程 evaluation 框架,分散 client 端负载,在每秒数千次 query 的生产规模下实现对 LLM 的精确、可复现 profiling。聚焦"测量本身"——传统 inference benchmark 在高并发场景下系统性低估吞吐、高估延迟,是 2026 H2 末 inference 评测可信度的基础工作。

它的方法论价值:

  • L1 评测方法学的边界硬约束:评测对象可以是 Agent / RAG / 多模态,但测量 infrastructure 本身必须是 production-grade——这是 baseline 之前的 baseline。
  • L2 与 AlphaEval 形成"评测对象 + 评测基础设施"二元化:AlphaEval 关注评测对象(哪个 agent 在哪个任务上更好),Systemic Measurement Bias 关注评测基础设施(测量结果是否可复现)。
  • L3 与 SeedRG 形成"评测反方"对照:SeedRG 反方对象是评测题集,Systemic Measurement Bias 反方对象是评测执行环境——两条反方主线共同构成 2026 H2 末评测元方法学"信任 artifact" 转向。

2.7 多 Agent 评测范式(评判体升级)

arXiv:2607.18529(0 S2 被引,3 HFD 票,paper_cards/527)——《EduPanel: A Three-Agent LLM Judge for Teaching Videos》

教学视频多 Agent 评判框架——rubric-grounded Agent + learner-conditioned Agent + 汇聚 Agent 构成三 Agent 评判架构。对教学视频的多模态证据做拆解评估,产出可解释的教学质量评估。学习者画像条件化是该方向少见的切入角度。

它的方法论价值:

  • L1 从单一评判体升级到多 Agent 评判体:与活文档 R25 §2.7 Agent-as-a-Judge 范式互补——前者是"评判体内部多 Agent 协作",后者是"评判体协同多模型"。
  • L2 与 DocOps 形成"评测方法论二元对照":DocOps 是"结构化可验证评测"(评估对象 = 文档操作),EduPanel 是"开放式多 Agent 评判"(评估对象 = 教学视频)——前者追求确定性,后者追求可解释性。
  • L3 与 Manager Coercion AI-to-AI 治理评测(活文档 R25)互补:Manager Coercion 关注多 Agent 协调失效,EduPanel 关注多 Agent 协调增益——前者是反方,后者是正方。

3. 多视角评价

3.1 工程视角(可落地性)

  • 可立即落地:AgentCompass(arXiv:2607.13705)原生支持 20+ benchmark × 5 capability dimensions,异步运行时 + 轨迹分析工具已开源;AlphaEval(arXiv:2604.12162)94 任务 × 7 公司的生产基准可直接复用其需求 → 基准构建框架;SeedRG(arXiv:2605.08838)的半合成 benchmark 生成 pipeline 可直接套用到 RAG 评测。
  • 可作为方法论参考:Rethinking Harness Evolution(arXiv:2607.12227)三层反方体系是审计 harness 自演进工作的必备工具;Systemic Measurement Bias(arXiv:2605.24217)多进程 evaluation 框架是 production-scale 推理评测的基础。
  • 落地门槛较高:EduPanel(arXiv:2607.18529)三 Agent 评判架构需要 rubric 专家 + 学习者画像 + 多 Agent 编排;DocOps(arXiv:2607.19865)层级化分类法需要领域专家共建——单个团队小规模用没问题,但要成为行业标准需要跨公司共建。

3.2 研究视角(创新性)

  • 方法论创新:AgentCompass 三组件解耦是把"评测套件"从 monolith 转向 matrix 的标志性工作;SeedRG 把 benchmark leakage + aging 量化是评测基线本身的可信度建设;Rethinking Harness Evolution 把 harness evolution 评测协议元层化是 harness 自演进研究的关键反方。
  • 范式创新:从 score-only → trace-driven evaluation(活文档 R25 §3);从静态题海 → 可验证世界;从单一评判体 → 多 Agent 评判体(EduPanel);从单 point score → 协议 + 审计 + 反方三位一体。
  • 仍未充分解决的问题:评测 sample efficiency(256 题 vs 23,088 题的统计功效差距);跨领域评测可比性(金融 QA vs 文档操作 vs 教学视频无可比单位);评测对真实生产场景的迁移性(89% / 52% 缺口 / 37pp gate ⚠️ Substack 数字待独立核验)。

3.3 批判视角(局限)

  • 评测自身的"评测"严重不足:Rethinking Harness Evolution 揭示 harness evolution 评测协议的 matched budget loophole;SeedRG 揭示 RAG 评测的 leakage + aging;Systemic Measurement Bias 揭示 inference benchmark 的测量偏差——2026 H2 末的评测领域共识是"我们不知道评测本身是否可信"。
  • 垂直评测的规模困境:FinMMEval 256 题 vs T²-RAGBench 23,088 题(⚠️ 单一 paper_card 来源);LegalBench-RAG 6,858 pair;HealthBench 48,562 rubric criteria——垂直评测规模差异 3 个数量级,跨垂直评测的可比性基本不存在。
  • LLM-as-Judge 的可靠性反方:Kili / LangChain / Giskard 三家 2026 报告均强调 LLM-as-Judge 必须经过 human 校准("a judge must be validated against the humans whose judgment it is meant to scale"),但 2026 H2 末 JRH(Judge Reliability Harness, RAND Corporation 2026-07-19,活文档 R23 §2.1)是把 judge 校准从"trust 论文"推到"trust artifact"的第一份工程化工作,普及度仍不高。
  • 评测领域自身也可能 reward hacking:hacking_gap = val_pass − holdout_pass 每 10× 代码量增加约 28pp(flyP 7-20 E2 精读,⚠️ held-out 隔离性待 PDF 核)——评测本身也面临"在 val 上 overfit"的风险。

4. 趋势判断与开放问题

4.1 三大趋势

  • 趋势一:评测基础设施工程化。AgentCompass 三组件解耦 + HealthBench 48K rubric + LegalBench-RAG 6,858 pair 表明 2026 H2 末评测领域的工业级立标密集出现,从"论文 baseline"走向"生产管线"。评测基础设施(异步运行时 + 评测组件矩阵 + 跨 harness 可移植性)正在成为下一个独立的 engineering stack 层。
  • 趋势二:评测可信度元层化。Rethinking Harness Evolution + SeedRG + Systemic Measurement Bias + JRH + Kili 2026 报告共同构成"评测反方"主线——评测自身可信度(judge 校准 / leakage 量化 / 测量偏差消除 / 协议元层化)成为与"评测对象"同等重要的研究维度。
  • 趋势三:垂直领域评测规模化。DocOps(办公文档)+ FinMMEval(金融 QA)+ AILQA(法律 QA)+ HealthBench(医疗)+ LegalBench-RAG(法律 RAG)构成 2026 H2 末垂直评测矩阵。Gartner 预测 2027 年超过 50% 企业 GenAI 模型是 domain-specific(kili-technology.com),垂直评测将"load-bearing"——benchmark 层与 expert-review 层必须共存。

4.2 开放问题

  • Q1: 评测基础设施的互操作性如何实现? AgentCompass 三组件解耦是开端,但跨研究的 evaluation 仍普遍存在"评测不公开 / 评测脚本不公开 / 评测环境不一致"——开源异步运行时 + 跨 harness 矩阵化 + 跨环境容器化是可能路径。
  • Q2: 评测反方的元层化如何标准化? Rethinking Harness Evolution 三层反方体系是 harness evolution 领域的方法论共识,但 leakage / aging / measurement bias / judge reliability 四类反方尚未形成统一框架——JRH 是 judge reliability 方向的第一份工程化工作,但时点偏晚(2026-07-19)。
  • Q3: 垂直评测的样本效率与跨域可比性有何路径? FinMMEval 256 题 vs T²-RAGBench 23,088 题 vs HealthBench 48K rubric 的规模差异 3 个数量级,跨垂直评测的可比性基本不存在。半合成 + LLM-as-Judge + 跨域 rubric 复用是可能路径,但样本效率与跨域可比性的权衡仍是开放问题。
  • Q4: 生产评测与离线评测的差距如何收敛? 89% / 52% / 37pp 缺口(⚠️ Substack 数字待独立核验)说明生产场景与离线评测的差距巨大。AlphaEval 94 任务从 7 家公司采集是开端,但生产场景的覆盖率、任务复杂度、评测一致性仍待解决。
  • Q5: LLM-as-Judge 与多 Agent 评判的边界在哪? EduPanel 三 Agent 评判 vs 单一大模型评判在开放式教学质量评估上哪个更可靠(活文档 R25 §7.2 第 27 条争议)仍是开放问题。

4.3 风险与边界

  • 数字风险:活文档 R25 §3.3 中"89% / 52% / 37pp" 来自 The AI Engineer Stack 2026 报告(Substack 二手转述),需独立原始报告核验;T²-RAGBench 23,088 题来自 paper_card 注释,原始 paper 数字未核;LoCoMo 40-60% 跌至来自 paper_card 注释,原始 paper 数字未核。
  • 框架风险:Rethinking Harness Evolution 三层反方体系(活文档 R25 §6.22)是 Tom 预消化简报中的总结性框架,原始 paper 是否使用同样层级标签(如 L1 / L2 / L3)需原文核验。
  • 覆盖风险:本综述精选 8 篇 + 4 篇补充 paper_card 详读,未覆盖 60 篇主分类 evaluation 论文卡中的其他 52 篇;活文档 R25 §2.7 提到的 60+ 子领域 / Compass 六件套 / Harness Engineering 双轴五件套等未在本综述中详尽展开,详见 2026-07-21 evaluation 综述姊妹篇。

5. 总结

2026 H2 末 evaluation 主题已经进入"评测基础设施 + 评测反方 + 垂直评测规模化"三轨并进阶段。AgentCompass 三组件解耦 + 20+ benchmark × 5 capability dimensions 是评测基础设施工程化的立标;Rethinking Harness Evolution + SeedRG + Systemic Measurement Bias + JRH 共同构成评测反方主线;DocOps / FinMMEval / AILQA / HealthBench / LegalBench-RAG 构成垂直评测矩阵。八篇主力论文覆盖了综述(2307.03109 / 2507.21504 / 2606.11435)、评测基础设施(2607.13705)、评测反方(2607.12227 / 2605.08838)、生产场景(2604.12162)、推理基准(2605.24217)、垂直领域(2607.19865 / 2607.19867)、多 Agent 评判(2607.18529)——共同刻画 2026 H2 末"评测 = 信任 artifact"这一范式跃迁。

下一个 6-12 个月的评测领域,将围绕"评测基础设施互操作性 / 评测反方元层化 / 垂直评测样本效率 / 生产-离线差距收敛 / LLM-as-Judge 边界"五大开放问题展开。