主题综述 · evaluation(2026-07-29)
- 作者:spark
- 更新:2026-07-29
本文综合
/shared/research-kb/organized/paper_cards/主分类 evaluation 近 3 天高信号论文卡(628-2607.23402、631-2607.22561、640-2607.24368、642-2607.24957、611-2607.22345、617-2607.20465、522-2607.18825、527-2607.18529、528-2607.18934)、/shared/research-kb/organized/promo/explainers/7-29 同步解读、/shared/research-kb/inbox/tom/2026-07-28-evaluation-e1prep.md与2026-07-29-evaluation-e1prep.md两份 E1 预消化、/shared/research-kb/organized/knowledge/evaluation.md活文档 R29、PAJAMA 官方项目页与 InMind HF 论文页对 2026 H2 末评测做深度综述。8 篇主力论文均带 arXiv ID 出处,未核数字以 ⚠️ 标注。
1. 主题脉络:从"评测套件可信度审计"到"评测维度自身缺失审计"
2026 H2 末 evaluation 主题相比 7-24 综述关注的"评测基础设施元层化(AgentCompass / AHE / JRH)+ 评测反方(Rethinking Harness Evolution / SeedRG / Systemic Measurement Bias)+ 垂直评测规模化(DocOps / FinMMEval / AILQA / HealthBench / LegalBench-RAG)"三轨并进,已演进为"评测套件自身可信度审计 → 评测维度自身系统性缺失审计"的更激进转向。本期 4 条 E1 增量(2 确认 + 2 邻接)虽薄但全部集中在该主线下:
- PAJAMA(arXiv:2607.22561) 把 LLM-as-judge 的可信度从"trust prompt"推到"trust 程序化评判委员会"——是 R26 JRH 的"反方向工程化落地"。
- InMind(arXiv:2607.24368) 把评测反方从"基准饱和 / 泄漏 / 老化(SeedRG)"和"hacking_gap(SpecBench)"推到"评测维度自身系统性缺失"——暴露 84.0%(in-context 天花板)vs 14.4%(检索最佳)vs ~100%(同题显式召回)的 70pp 鸿沟。
- PerceptionBench(arXiv:2607.24957) 把"评测维度自身缺失审计"推到多模态视觉感知层——定义 10 个原子视觉感知能力,揭示"任何前沿 MLLM 都不过 60% / 感知幻觉最弱 / 总分相近能力剖面差异巨大"三连结论。
- Warp Divergence(arXiv:2607.23402) 把"评测基础设施元层化"延伸到 GPU 微架构层——量化 ITS 以来 GPU warp divergence 的稳定线性串行化模型(
T(k) ≈ sk)与代际重汇聚机制(Pascal SSY/SYNC 栈 → Ampere+ barrier-register → Blackwell 两层 convergence barrier)。
四条增量合流的核心信号:"评测维度自身缺失审计"成为 2026 H2 末评测反方主轴的新层级——从"分数不饱和就怀疑基准饱和(SeedRG / FrontierMath v2 修正)" → "分数不饱和就怀疑 judge 自身有偏(JRH / PAJAMA)" → "分数不饱和就怀疑评测维度本身从未被覆盖过(InMind / PerceptionBench)"。
2. 各工作贡献与相互关系
2.1 LLM-as-judge 的程序化替代(PAJAMA)
arXiv:2607.22561(paper_cards/631)——《Codifying the Judge: Scalable Evaluation via Program Distillation》。
2026 H2 末直面 LLM-as-judge 三大缺陷——高成本(每样本 LLM API)/ 高延迟(流水线瓶颈)/ 决策不透明(黑箱打分)——提出程序蒸馏(Program Distillation)作为可扩展替代:不再在评测时调用 LLM,而是用 LLM 标注数据训练一个"程序委员会"(committee of programs),程序接受同样的输入、直接输出分数。工程实现是 PAJAMA(Programmatic Judge Architecture)系统——一组 n 个程序化 judge 并行打分 → 弱监督聚合 → 联合判决 → 低置信度 fallback 回 LLM judge。
关键实验数据(Sprocket Lab 官方页面 / Emergent Mind 综述): - 匹配 13B LLM judge:在 RewardBench / MT-Bench / ChatEval / SummEval 等 5 个数据集 × 4 个模型家族上,PAJAMA 程序化 judge 准确率与 13B LLM judge 持平。 - 偏见缓解:相对 Qwen2.5-14B LLM-as-judge,评判一致性 +15.83%,偏见响应 -23.7%(⚠️ 来自 Emergent Mind 综述,原文 PDF 未独立核验)。 - 奖励信号蒸馏:用程序 verdict 蒸馏的 reward model 在 RewardBench CHAT-HARD 上超越 GPT-4 labels 训练的 reward model:Prometheus +2.19%、其他 +8.67%。 - 成本两个数量级降低:合成全部程序成本仅 $0.053(vs LLM-as-judge labels 的 $133–300);reward model 训练标注成本低 45-50×。
与活文档 R29 脉络的关系:落入 §2.4「Judge & Harness 工程」——是 R26 JRH 的"反方向工程化落地":JRH 校准 judge 自身可靠性(保留 LLM、量化其可靠性),PAJAMA 把 judge 整个蒸馏为程序(去掉 LLM、把决策逻辑代码化)。两者方向相反但互补——JRH 适合高维开放式评估,PAJAMA 适合可规则化、规模化、成本敏感场景。与 Lilian Weng Harness Engineering 同构——都将"运行时推理"蒸馏为"可执行代码"。
反方:复杂评测维度(教学视频质量 / 法律推理质量 / 创造性写作)的专业判断是否可完全规则化尚存疑;PAJAMA 在数学证明 / 临床决策的评测质量与原始 LLM-as-judge 的差距原文未充分验证;程序表达能力上限仍是开放问题。
2.2 评测维度自身系统性缺失的首次系统化(InMind)
arXiv:2607.24368(paper_cards/640,HF 票数 19▲ 7-29)——《Keep It InMind: Benchmarking the Implicit-Association Blind Spot in Agent Memory》。
2026 H2 末把评测维度自身缺失审计首次系统化的工作。核心问题:长期记忆系统行业普遍默认"需要被用到的记忆一定会在文本上和查询长得像"——但世界知识击穿了这个假设:用户对树坚果过敏 → 用户问"能吃马卡龙吗?"答案依赖"杏仁粉来自杏仁"这一桥接事实,但"过敏"和"马卡龙 / 杏仁"之间没有共享字面 cue。
核心方法与数据(HF 论文页直接确认): - InMind benchmark:125 个任务 × 10 个生活领域,专家验证,113/125 任务可追溯到公开信息源。 - 配对控制(paired controls):每个任务都设计三种易混淆解释的对照——C1:事实根本没被存 / C2:模型缺乏桥接知识 / C3:事实被存了但检索阶段没召出来(InMind 真正想测的盲点)。 - 关键实验: - 直接 in-context:把"决定性记忆"放在 prompt 里。模型能用答:84.0%(模型"理解能力"的天花板)。 - 检索条件:六大记忆系统(HippoRAG 2, A-RAG, A-Mem, Mem0, MemoryOS, xMemory)最高答对率:14.4%。 - 同题显式召回:让系统被问"请列出用户所有过敏原"时,接近 100% 的事实被召回——即"事实确实在库里,但该用的时候用不到"。 - 最小诊断探针:让"决定性记忆"始终保留在视野中(仅位置或可见性变化),恢复了大半 gap——坐实问题在 routing,不在 LLM,也不在记忆库容量。 - embedding 维度实验:把 embedding 模型从基线换到 8 倍维度——每个系统的 answer-blind target recall 都提升了,但gap 几乎没缩小——反驳"换更大的 embedding 就能解决"的直觉。
与活文档 R29 脉络的关系:落入 §1.1「评测对象扩展」+ §2.2「Benchmark 设计」+ §1 现状全景 #2「Agent / RAG / 长上下文系统暴露'不可见失败'」三条主线——InMind 是首个系统性把"评测维度自身缺失"作为 benchmark 维度的研究。与 R26 Deceptive Grounding(13 模型 100% 实体归属失败)同源"看不见的失败",但 InMind 聚焦"隐含关联"而非"实体归属"。
与 R25 LoCoMo / LoCoMo-Plus / ImplicitMemBench 的对照(InMind 原文 § 相关工作明确区分): - LoCoMo(Maharana et al., 2024):长对话记忆,关联由 LLM 模拟对话生成——"模型自己提的关联,测试时也容易自己推导出"。 - LoCoMo-Plus(Li et al., 2026):认知记忆,测"用户状态 / 目标 / 价值"在 cue-trigger 语义断开下能否存活。 - ImplicitMemBench(Qin et al., 2026):行为隐式记忆,Learning–Interfere–Test 短协议下的程序性学习 / 启动 / 条件化。 - InMind:知识介导的"显式用户事实"应用,关联依赖外部可验证的桥接,113/125 任务源溯公开信息——这是它与上述三件的关键差异(避免"LLM 自生成 → 自评测"的循环偏差)。
反方:规模 125 题偏小(统计显著性可能受限);领域局限(覆盖"日常生活",未覆盖企业 / 工程 / 编程场景的 agent 记忆);静态评测(一次写入 + 一次查询,未测长期演化);桥接知识来源假设可能放大或缩小 14.4% 数字。
2.3 多模态评测的"原子感知缺失"诊断(PerceptionBench)
arXiv:2607.24957(paper_cards/642,副分类 multimodal,HF 票数 5▲ 7-29)——《PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models》。
2026 H2 末把"评测维度自身缺失审计"推到多模态视觉感知层的工作。现有 MLLM 评测有两条盲点:① 整体性评测混淆错误("答错一道题到底是没看清图还是不会推理");② 应用驱动型评测碎片化。PerceptionBench 的核心思路是bottom-up 诊断:先看 MLLM 答错题时最早出错的是哪一步,再把"最早出错"分类,最终分类里和推理 / 知识无关、纯看图出错的那一支就是"原子视觉感知"。
核心方法:在 42 个现有 benchmark 上系统跑了前沿 MLLM,对失败响应做错误归因,得到一棵错误分类树。树的"感知分支"细化成 10 个原子能力:物体识别 / 计数、属性识别(颜色、形状、材质)、空间关系、文字 / OCR 识别、细粒度区分、场景理解、时间 / 运动、图表结构 / 数据读取、抽象视觉模式、感知相关幻觉。题目构造:3,000 道 / 10 个原子能力 / 全部人工核验——每题只测一个原子能力,答案短且明确,难度来源只能是感知,不允许靠推理 / 外部知识绕过。
关键结论(flyP 7-29 explainer 2607-24957 详述): - 原子感知远未解决:16 个前沿 MLLM(含 GPT-4o / Claude / Gemini / Qwen-VL / InternVL 等一线),没有任何一个跨过 60% 准确率。 - 感知相关幻觉是最弱能力:不仅"看错",还"看到不存在的东西"——后者往往更难发现、对下游任务危害更大。 - 总分掩盖能力剖面:两个模型总分接近,但在 10 维能力向量上的分布完全不同——意味着单数字打分对选型基本无用。
与活文档 R29 脉络的关系:落入 §1 现状全景 #5「多模态评测进入饱和期 + 套件自身可被解构」——PerceptionBench 是"套件自身可被解构"的具体方法。与 R26 Apple-π(视频生成物理定律 grounding)同构——Apple-π 把"评测失败"分解到推理链逐帧,PerceptionBench 把"评测失败"分解到原子感知错误分类。
反方:10 个原子能力粒度不均(OCR 和细粒度识别难度量级不同);"短答案"不考察多跳 / 序列感知;3,000 题对稳健能力剖面评估仍偏小;全部题目来自 42 个现有 benchmark 的失败改写,与原生分布可能有偏;诊断而非处方。
2.4 评测基础设施的底层性能审计(Warp Divergence)
arXiv:2607.23402(paper_cards/628)——《Characterizing Warp Divergence from Pascal to Blackwell》。
把"评测基础设施元层化"延伸到 GPU 微架构层的工作。Warp divergence(线程束分歧)是 CUDA/GPU 编程的核心性能问题。自 Volta(2017 年)引入独立线程调度(ITS)以来,业界普遍假设现代 NVIDIA GPU 以固定且文档不透明的方式处理 warp divergence,但从未被系统验证。
核心方法:① 周期精确微基准测试;② 硬件计数器(nvprof / NVTX);③ 编译器 SASS 静态分析。覆盖代次:Pascal(P100)、Ampere(A100)、Hopper(H100)、数据中心与消费级 Blackwell(B100 + RTX 50 系列)。
关键发现:
- F1:分歧串行化线性增长,无超线性惩罚——T(k) ≈ s × k。
- F2:Warp 执行效率 = 32/k,occupancy 不影响惩罚——Predication(谓词执行)可消除串行化成本。
- F3:编译器重汇聚机制代际演变——Pascal SSY/SYNC 栈 → Ampere/Hopper barrier-register → Blackwell 两层 Convergence Barrier + Uniform Branch。
- F4:延迟重汇聚大幅减少——Ampere 上有 29 个延迟重汇聚 case,Blackwell 上仅剩 2 个。
- F5:Blackwell Barrier 是静态编译分类。
与活文档 R29 脉络的关系:落入 §2.2「Benchmark 设计」+ §2.5「评测方法学批判」——Benchmark 自身方法论局限性(向量数据库 ANN-Benchmarks 使用过时低维数据集的陷阱 / Warp Divergence 静态 benchmark 无法反映 compiler-level 重汇聚演进)共同构成"基础设施层 Benchmark 方法论批判"。
反方:评测 warp divergence 串行化模型与重汇聚机制,不直接评测 AI 工作负载端到端性能;编译器是 NVIDIA 私有,无法直接对比 AMD / Intel GPU;不涉及 tensor core / 矩阵乘法等 AI 关键路径。
2.5 评测对象的纵向延续
arXiv:2607.22345(paper_cards/611)——Teachy Mini:2026 H2 末具身社交机器人评测基准,补充 R29 评测对象 34 → 35 维(具身教育 KBD 评测)。Reachy Mini 机器人平台落地,Preliminary Evaluation 覆盖知识准确性 / 辅导行为有效性 / 错误响应处理 / 透明度指标。
arXiv:2607.20465(paper_cards/617,副分类 evaluation,HF Daily 7-28 40▲)——DataPrep-Bench:LLM 作为训练数据准备者的基准评测——"质量"指下游训练效用而非表面层级指标。
arXiv:2607.18825(paper_cards/522)——AILQA:已在 R26 覆盖,印度法律垂直 AI QA 评测,词法 + 语义 + 法学专家反馈三重评测。
arXiv:2607.18529(paper_cards/527)——EduPanel:已在 R26 覆盖,三 Agent LLM 评判框架(rubric-grounded + learner-conditioned + 汇聚)。
arXiv:2607.18934(paper_cards/528)——Transcription Policy:已在 R26 覆盖,ASR 评测 60% WER 归因于标注风格不匹配而非真实识别错误。
3. 多视角评价
3.1 工程视角(可落地性)
- 可立即落地:
- PAJAMA(arXiv:2607.22561)——合成程序成本仅 $0.053,reward signal 蒸馏成本低 45-50×。对每天跑几千次评测的 LLM 榜单极具吸引力;CI/CD 中集成程序 judge 做自动评分;移动端或私有化部署场景无 GPU / API 依赖。
- Warp Divergence(arXiv:2607.23402)——
T(k) ≈ sk模型可直接用于 AI 推理 kernel 性能预估(MoE 路由分支 / speculative decoding 分支 / dynamic batching 路径)。 - 可作为方法论参考:
- InMind(arXiv:2607.24368)——配对控制设计(事实是否存 / 模型是否有桥接 / 检索是否召出)是任何自研评测系统的诊断范本;最小诊断探针是定位 routing 问题的最小工程单元。
- PerceptionBench(arXiv:2607.24957)——bottom-up 错误归因是建立自评测系统的标准方法;10 维能力向量画像可迁移到任何多能力系统的选型。
- 落地门槛较高:PAJAMA 在数学证明 / 临床决策 / 创造性写作的程序表达能力上限未充分验证;InMind 规模 125 题偏小,对企业级 agent 记忆系统的评测迁移需自建扩展数据集。
3.2 研究视角(创新性)
- 方法论创新:
- PAJAMA 把 judge 决策逻辑蒸馏为可执行代码——把 judge 校准从"trust prompt"推到"trust 程序化评判委员会",与 Lilian Weng Harness Engineering 的"runtime → code 蒸馏"同构。
- InMind 把"评测维度自身缺失"作为 benchmark 维度——从 SeedRG / FrontierMath v2 修正的"基准饱和 → 怀疑泄漏"演进到"评测维度从未覆盖过 → 怀疑评测本身"。
- PerceptionBench bottom-up 错误归因——从"答对多少题"演进到"在哪一步开始看错图",是评测方法论上从 outcome-only leaderboard 演进到行为/轨迹诊断的延续。
- 范式创新:从 score-only → trace-driven evaluation(R25);从 judge 即 LLM → judge 即程序(PAJAMA R29);从"基准饱和"反方 → "评测维度缺失"反方(InMind / PerceptionBench R29);从"基准可信度"反方 → "基础设施可信度"反方(Warp Divergence R29)。
- 仍未充分解决的问题:PAJAMA 程序表达能力的理论上限;InMind 评测的"路由层"如何独立评测(路由 ≠ 检索 ≠ 存储);PerceptionBench 10 个原子能力的粒度均衡性;评测维度缺失审计的方法论统一(InMind 配对控制 / PerceptionBench 错误归因树 / SeedRG leakage 量化 / SpecBench hacking_gap 尚未形成统一框架)。
3.3 批判视角(局限)
- PAJAMA 的反方:蒸馏质量依赖初始 LLM judge——种子 LLM judge 有偏见则程序继承该偏见;领域迁移性未充分验证;程序表达能力上限未量化。
- InMind 的反方:规模 125 题偏小(统计显著性可能受限);领域局限("日常生活"覆盖,未直接迁移到企业 / 工程 / 编程场景);静态评测(一次写入 + 一次查询,未测长期演化);桥接知识来源假设可能放大或缩小 14.4% 数字。
- PerceptionBench 的反方:10 个原子能力粒度不均;"短答案"不考察多跳 / 序列感知;3,000 题对稳健能力剖面评估仍偏小;全部题目来自 42 个现有 benchmark 的失败改写,与原生分布可能有偏;诊断而非处方。
- Warp Divergence 的反方:评测 warp divergence 串行化模型与重汇聚机制,不直接评测 AI 工作负载端到端性能;编译器是 NVIDIA 私有,无法直接对比 AMD / Intel GPU;不涉及 tensor core / 矩阵乘法等 AI 关键路径。
- 评测领域自身的"评测"严重不足:Rethinking Harness Evolution 揭示 harness evolution 评测协议的 matched budget loophole(R26);SeedRG 揭示 RAG 评测的 leakage + aging(R26);Systemic Measurement Bias 揭示 inference benchmark 的测量偏差(R26);JRH 把 judge 校准从"trust 论文"推到"trust artifact"(R26);InMind / PerceptionBench 把"评测维度自身缺失"推到台面(R29)——2026 H2 末的评测领域共识是"我们不知道评测本身是否覆盖了所有该测的维度"。
- 垂直评测的规模困境:InMind 125 题 vs T²-RAGBench 23,088 题 vs HealthBench 48K rubric criteria(⚠️ 数字来自 R26 综述)——评测规模差异 3 个数量级。
- LLM-as-Judge 的可靠性反方:PAJAMA 本身是 LLM-as-judge 范式的反方——它把 judge 整个蒸馏为程序而非校准 judge。但 PAJAMA 在高维开放式评估场景下的能力上限未充分验证,是"judge 校准(JRH)"与"judge 替代(PAJAMA)"两条路线的边界争议。
4. 趋势判断与开放问题
4.1 三大趋势
- 趋势一:评测维度自身缺失审计成为新主轴。InMind 70pp 鸿沟 + PerceptionBench "无模型过 60% / 感知幻觉最弱 / 总分相近能力剖面差异巨大"三连结论 + PAJAMA "LLM-as-judge 三大缺陷"共同表明:2026 H2 末的评测反方已经从"基准饱和 / 泄漏 / 老化 / hacking"演进到"评测维度从未覆盖过 + judge 决策不透明"。这与 R26 SeedRG / SpecBench / JRH 形成"评测反方四元闭环"(基准饱和 → 怀疑泄漏 → 怀疑 hacking → 怀疑 judge → 怀疑维度缺失)。
- 趋势二:judge 从"LLM-as-judge"走向"code-as-judge"。PAJAMA 把 judge 决策逻辑蒸馏为程序委员会 + reward signal 蒸馏在 RewardBench CHAT-HARD 上超越 GPT-4 labels——这是 judge 范式的范式跃迁:R26 JRH 是"保留 LLM + 量化可靠性",R29 PAJAMA 是"去掉 LLM + 把决策代码化"。两者方向相反但互补——前者适合高维开放式评估,后者适合可规则化、规模化、成本敏感场景。
- 趋势三:评测对象向底层基础设施延伸。Warp Divergence 把评测基础设施元层化从 LLM / Agent / RAG / 多模态 / 教育 / 金融 / 法律 / 医疗推到 GPU 微架构层——AI 系统端到端性能的可信评测需要从顶层 model snapshot 到底层 GPU 行为的一致性审计。这与向量数据库 ANN-Benchmarks 工业级实测(Salt Technologies R29)共同构成"评测基础设施的双层披露"。
4.2 开放问题
- Q1: 评测维度自身缺失审计如何标准化? InMind 配对控制 / PerceptionBench 错误归因树 / SeedRG leakage 量化 / SpecBench hacking_gap / Warp Divergence cycle-accurate microbenchmarks 尚未形成统一框架。
- Q2: judge 校准(JRH)与 judge 替代(PAJAMA)的边界在哪? JRH 适合高维开放式评估(教学视频质量 / 法律推理质量 / 创造性写作),PAJAMA 适合可规则化、规模化、成本敏感场景(榜单 / CI gate / RLHF reward)。
- Q3: 评测路由层(InMind 揭示)的独立评测方法是什么? InMind 最小诊断探针只是最小工程单元——如何独立评测 routing 决策(vs 检索 / 存储 / 理解)需要新的评测范式。
- Q4: 评测维度向量(PerceptionBench 10 维)的工程化迁移如何实现? 10 维能力向量画像从 MLLM 视觉感知迁移到任何多能力系统的选型——如何标准化"能力向量维度定义 + 跨系统可比性"。
- Q5: 评测基础设施双层披露(GPU 微架构 + 向量数据库 + LLM 推理 + Agent harness)的互操作性如何? Warp Divergence + Salt Tech 向量 DB + Systemic Measurement Bias + AgentCompass 三件共同构成基础设施层披露,但跨基础设施的端到端一致性评测仍未解决。
4.3 风险与边界
- 数字风险:PAJAMA "评判一致性 +15.83% / 偏见响应 -23.7% / RewardBench Prometheus +2.19% / +8.67%" 来自 Emergent Mind 综述,原文 PDF 未独立核验;合成程序成本 $0.053 / reward model 训练成本低 45-50× 来自 Sprocket Lab 官方页面,与原文 PDF 数字一致性需独立核验。
- 方法论风险:PAJAMA 程序表达能力的理论上限未量化;InMind 125 题规模偏小可能限制统计显著性;PerceptionBench 10 个原子能力粒度不均(OCR vs 细粒度识别难度量级不同)。
- 覆盖风险:本综述精选 8 篇 + 4 篇补充 paper_card 详读,未覆盖 70 篇主分类 evaluation 论文卡中的其他 62 篇;活文档 R29 提到的十六重范式跃迁 + 35 维评测对象未在本综述中详尽展开,详见 7-21 / 7-24 evaluation 综述姊妹篇。
5. 总结
2026 H2 末 evaluation 主题在 R26"评测基础设施 + 评测反方 + 垂直评测规模化"三轨基础上,新增第四条主轨:评测维度自身缺失审计。本期 4 条增量(PAJAMA / InMind / PerceptionBench / Warp Divergence)合流形成 2026 H2 末"评测 = 程序化 + 维度化 + 基础设施化"的范式跃迁:
- PAJAMA 把 LLM-as-judge 蒸馏为程序化评判委员会——judge 从"trust LLM"走向"trust code"。
- InMind 把"评测维度从未覆盖过"作为 benchmark 维度——评测反方从"基准饱和"走向"维度缺失"。
- PerceptionBench 把"原子感知缺失"作为多模态评测的反方——MLLM 评测从"答对多少题"走向"在哪一步开始看错图"。
- Warp Divergence 把评测基础设施元层化延伸到 GPU 微架构层——AI 系统端到端可信评测需要从顶层 model snapshot 到底层 GPU 行为的一致性审计。
八篇主力论文覆盖了 judge 工程(2607.22561 / 2607.18529)、评测维度缺失审计(2607.24368 / 2607.24957)、评测基础设施底层(2607.23402)、垂直领域延续(2607.22345 / 2607.20465 / 2607.18825)、跨域 oracle 消解(2607.18934)——共同刻画 2026 H2 末"评测 = 程序化 + 维度化 + 基础设施化"这一范式跃迁。
下一个 6-12 个月的评测领域,将围绕"评测维度缺失审计标准化 / judge 校准 vs 替代边界 / 路由层独立评测 / 能力向量工程化迁移 / 评测基础设施双层互操作性"五大开放问题展开。