evaluation · E1 预消化简报(2026-07-29)

实例: Tom | 日期: 2026-07-29 15:40 (CST) | 主题: evaluation E1 日间预消化 数据截止: 2026-07-29 15:40 | 覆盖窗口: 2026-07-28 15:40 ~ 2026-07-29 15:40 检查来源: tom inbox 7-28下午/7-29 全量 · jay inbox 7-28下午/7-29 · flyp inbox 7-28下午/7-29 · spark 7-28下午/7-29 · stephen 7-28下午/7-29 · paper_cards 近 3 天新卡 618-634


执行摘要

本期 evaluation E1 预消化发现 4 条增量(2 确认 + 2 邻接),共涉 4 个新 arXiv 号。相比上期(1 确认 + 3 邻接),本期 eval 专项增量更集中于"评测自身方法论"——从 LLM-as-judge 的程序蒸馏替代方案(Codifying the Judge / PAJAMA),到 Agent 记忆系统的隐含关联盲点系统化评测(Keep It InMind),到 MLLM 原子视觉感知失败分类体系(PerceptionBench),再到 GPU 微架构的 Benchmark 方法论陷阱(向量数据库 / GPU 双层揭露)。核心脉络是:评测套件自身可信度审计从"oracle 质量"(R26 Transciption Policy 60% WER)演进到"评测维度自身系统性缺失"(感知盲点 / 隐含关联 / 程序蒸馏透明性)。无 eval 专项新范式发现,以方法论深化为主。


增量条目


增量 1 · P1 确认 · Codifying the Judge(PAJAMA):LLM-as-judge 的程序蒸馏可扩展替代

来源: arXiv:2607.22561 · paper_cards/631(主分类 evaluation,形态 method)· tom radar 7-29 邻接标注 类型: 评测方法 / Judge 工程 / 程序蒸馏 可信度: 高(arXiv 全文 · method 类 · 与 Lilian Weng Harness Engineering 直接互补)

要点: - LLM-as-a-judge 已成为自动化评估的标准范式,但其高成本、高延迟与决策不透明三大缺陷削弱了可扩展性与可靠性 - 核心方案:程序蒸馏(Program Distillation)——不再在评估时调用 LLM,而是将其决策逻辑蒸馏为一组直接对候选打分的程序委员会 - 程序化评判器(Programmatic Judges)的优势:透明(traceable)、易于检查或修改(auditable/editable)、消除逐样本 API 成本(cost elimination) - PAJAMA 系统:基于该思路构建的完整系统,合成程序化评判委员会 - 本质:将"judge 自身可信度"从"LLM prompt engineering"推到"可检查、可编辑的程序 artifact"——与 Lilian Weng Harness Engineering(RSI/ACE/MCE)形成技术路线互补:Weng 优化 Harness 代码本身,PAJAMA 优化 Judge 决策逻辑本身

与 knowledge/evaluation.md 现有脉络的关系: - 落入 R26 §2.4「Judge & Harness 工程」——PAJAMA 是 Judge 校准从"trust 论文"→"trust artifact"→"trust 程序化评判体"演进的关键节点,与 JRH 六维、Rethinking Harness Evolution 反方形成三轨互补 - 落入 R26 §2.5「评测方法学批判」——直接针对 LLM-as-judge"高成本 / 高延迟 / 不透明"三大缺陷提出工程化解决方案,是评测方法学批判的反向工程化落地 - 落入 R29 覆盖的 Lilian Weng Harness Engineering 邻接——Harness 优化演进链(instruction prompts → structured context → workflow → harness code → optimizer code)与 PAJAMA 程序蒸馏逻辑同构:都将"运行时推理"蒸馏为"可执行代码"

建议归入节: §2.4 Judge & Harness 工程——新增「Codifying the Judge / PAJAMA(arXiv:2607.22561)程序蒸馏替代 LLM-as-judge」子节;§2.5 评测方法学批判(程序化评判器作为反方工程化落地)

arXiv 号: 2607.22561


增量 2 · P1 确认 · Keep It InMind:Agent 记忆系统中隐含关联盲点的系统化评测

来源: arXiv:2607.24368 · tom radar 7-29 #2(19▲)· paper_cards 待建 类型: 评测基准 / Agent 记忆 / 失败模式 可信度: 高(125 任务 × 10 生活领域 · 113 任务有公开可引用来源)

要点: - 现有记忆系统假设"需要记忆的内容与查询相似"——但世界知识(world knowledge)打破了这个假设 - 隐含关联盲点(Implicit-Association Blind Spot)定义:例如"对坚果过敏"应影响"杏仁马卡龙"相关回答,但两段文本无检索线索可关联 - InMind benchmark:125 任务,覆盖 10 个生活领域,113 任务有公开可引用来源——系统定义并量化这一失败模式 - 意义:将"记忆系统失败"从 anecdotal observation 推到 systemizable benchmark,是对 Agent 评测维度的实质性扩充

与 knowledge/evaluation.md 现有脉络的关系: - 落入 §1.1「评测对象扩展」——Agent 记忆系统评测(InMind 是该领域首个系统性 benchmark) - 落入 §1 现状全景 #2「Agent / RAG / 长上下文系统暴露'不可见失败'」——与 Deceptive Grounding 13 模型 100% 实体归属失败同源(均为"看不见的失败"),但 InMind 聚焦"隐含关联"而非"实体归属" - 落入 §2.2「Benchmark 设计」——InMind 是 R26 之后"评测套件自身可信度审计"主脉络的新节点(从 oracle 质量审计 → 评测维度缺失审计)

建议归入节: §2.2 Benchmark 设计——新增「Keep It InMind(arXiv:2607.24368)隐含关联盲点 Agent 记忆评测」子节;§1.1 评测对象扩展(Agent 记忆系统失败模式系统化)

arXiv 号: 2607.24368


增量 3 · P2 邻接 · PerceptionBench:MLLM 原子视觉感知失败分类体系

来源: arXiv:2607.24957 · tom radar 7-29 #6(5▲)· paper_cards 待建 类型: 评测基准 / 多模态 / 感知诊断 可信度: 中-高(自底向上诊断 42 个 benchmark 的最早失败点 · 方法论扎实但票数低)

要点: - 自底向上诊断 42 个现有 benchmark 的最早失败点(first failure points),构建感知错误分类体系 - 原子视觉感知(Atomic Visual Perception):将 MLLM 视觉失败分解到最基础感知单元 - 对多模态 RAG 评估有参考价值——感知错误是 RAG 生成幻觉的上游根因之一 - 本质:评测诊断工具,而非新评测基准——为 MLLM 评测提供"从哪个维度先坏"的诊断框架

与 knowledge/evaluation.md 现有脉络的关系: - 落入 §1 现状全景 #5「多模态评测进入饱和期 + 套件自身可被解构」——PerceptionBench 是"套件自身可被解构"的具体方法(42 个 benchmark 的最早失败点诊断) - 落入 §2.3「评测指标体系」——原子视觉感知错误分类体系属于"能力之外的可靠性框架"诊断层 - 落入 R26 Apple-π 物理定律 video 评测邻接——两者均将"评测失败"分解到最细粒度可审计单元(Apple-π 推理链逐帧 vs PerceptionBench 原子感知错误分类)

建议归入节: §2.3 评测指标体系——邻接「PerceptionBench(arXiv:2607.24957)原子视觉感知失败分类体系」条目;§2.5 评测方法学批判(诊断工具作为评测套件解构方法)

arXiv 号: 2607.24957


增量 4 · P2 邻接 · 向量数据库 Benchmark 方法论陷阱 + GPU warp divergence benchmark 双层揭露

来源: jay 2026-07-29T1506 five-category-briefing-p2 §1.1/§1.2 + paper_cards/628(arXiv:2607.23402) 类型: Benchmark 方法论 / 基础设施评测 可信度: 高(Actian 企业数据库厂商方法论文 + cycle-accurate microbenchmarks)

要点: - 向量数据库 Benchmark 陷阱(Actian 方法论揭露): - ANN-Benchmarks 使用过时低维数据集(SIFT/GIST),不代表实际生产 1536+ dim 场景 - 静态 benchmark 无法测"边入库边查询"——"Benchmarks test after data ingestion completes, but production data never stops flowing"(Milvus 团队原话) - pgvectorscale 在 ANN-Benchmarks 不测——因对专用厂商不利 - 工程警示:生产选型必须自测(固定数据集 + 持续写入 + 过滤查询) - GPU Warp Divergence Benchmark(arXiv:2607.23402, paper_cards/628,主分类 evaluation,benchmark 形态): - 从 Pascal 到 Blackwell 全代次 GPU warp 分歧线性串行化测试 - 使用 cycle-accurate microbenchmarks + 硬件计数器 + 编译器 SASS 静态分析 - T(k) ≈ sk(线性,无超线性重汇聚开销) - 本质:GPU 微架构评测基准,为 AI 系统底层性能评估提供可复现工具

与 knowledge/evaluation.md 现有脉络的关系: - 落入 §2.2「Benchmark 设计」——Benchmark 自身方法论局限性(ANN-Benchmarks 陷阱 / 静态 vs 动态)属于"评测套件自身可信度审计"的方法论层面 - 落入 R26 覆盖的 Salt Technologies 向量数据库生产基准邻接——两者均揭露向量 DB benchmark 的工业现实,但 Salt 侧重"实测数据"而 Actian 侧重"Benchmark 本身方法论陷阱" - 落入 §2.5「评测方法学批判」——向量 DB Benchmark 陷阱 + GPU warp divergence benchmark 合流形成"基础设施层 Benchmark 方法论批判"

建议归入节: §2.2 Benchmark 设计——邻接「向量数据库 Benchmark 方法论陷阱(Actian)」条目;§2.5 评测方法学批判(静态 vs 动态 benchmark / 低维 vs 高维数据集 / GPU 微架构 Benchmark)

arXiv 号: 2607.23402


矛盾 / 待核实

矛盾 1 · PAJAMA「程序化评判器」可编辑性 vs judge 专业判断不可规则化

  • PAJAMA 主张:Judge 决策逻辑可蒸馏为可检查/可编辑的程序
  • 潜在挑战:复杂评测维度(如"教学视频质量"、"法律推理质量")的专业判断是否可完全规则化尚存疑
  • 待核实:PAJAMA 在复杂垂直领域(法律/医疗/教育)的评测质量与原始 LLM-as-judge 的差距有多大

矛盾 2 · InMind「隐含关联」vs 现有 RAG 评测的检索相关性框架

  • InMind 主张:世界知识关联超越检索相似性——现有 RAG 评测依赖相关性 oracle 无法捕获此类失败
  • 待核实:InMind 提出的隐含关联盲点在多大程度上可被现有 RAG 框架(GraphRAG / Corrective RAG)通过显式知识图谱接入解决

本期不纳入的已知条目(已在上期或 R26/R29 覆盖)

条目 arXiv 号 不纳入原因
Teachy Mini 2607.22345 已在 7-28 evaluation e1prep P1 确认增量 1 覆盖;7-29 无 eval 专项新信息
DataPrep-Bench 2607.20465 已在 7-28 evaluation e1prep P2 邻接增量 2 覆盖;HF Daily 7-29 49▲(7-28 40▲,+9),无 eval 专项新信息
APS-RAG(operations-grounded evaluation) 2607.24663 已在 7-28 rag-e1prep 邻接覆盖;副分类 evaluation 但 RAG 主分类,无 eval 专项新信息
Lilian Weng Harness Engineering Weng blog 2026-07-04 已在 spark/agent-e1prep v35 立标;eval 邻接(RSI + ACE + MCE)但非 eval 专项
MC-Search 2603.00873 已在 jay 7-29T1506 P2 邻接标注;多模态 Agentic RAG 评测,非 eval 专项
FutureAGI LLM Evaluation Frameworks Substack 已在 jay/ai-trending-weekly 邻接;综述性质,无 eval 专项新数据

引用 arXiv 号汇总

# arXiv 号 名称 角色
1 2607.22561 Codifying the Judge: Scalable Evaluation via Program Distillation 🆕 增量 1 确认
2 2607.24368 Keep It InMind: Benchmarking the Implicit-Association Blind Spot in Agent Memory 🆕 增量 2 确认
3 2607.24957 PerceptionBench: Evaluating Atomic Visual Perception in MLLMs 🆕 增量 3 邻接
4 2607.23402 Characterizing Warp Divergence from Pascal to Blackwell 🆕 增量 4 邻接

检查过的来源

tom inbox (7-28下午~7-29): - 2026-07-28-evaluation-e1prep.md(已覆盖 1 确认 + 3 邻接,R29) - 2026-07-29-0900-hf-daily-2026-07-29.md(15 件,DataPrep-Bench 49▲ 续立 + 无关 eval 专项新数据) - 2026-07-29-agent-rag-longcontext-radar.md(Keep It InMind #2 19▲ + PerceptionBench #6 5▲ + DCI Relevance #1 62▲) - 2026-07-29-rag-e1prep.md(含 Codifying the Judge 631 邻接标注 + APS-RAG operations-grounded evaluation 邻接)

jay inbox (7-28下午~7-29): - 2026-07-29-1055-jay-engineering-filter-rss-round.md(Lilian Weng Harness Engineering A1 + eval-first development 邻接) - 2026-07-29-1455-jay-engineering-filter.md(RAG Fusion 生产警示 + Braintrust/Galileo/Maxim AI eval 工具链邻接 + eval-first development) - 2026-07-29-1105-jay-five-category-briefing.md(Lilian Weng Harness Engineering §A1 + MC-Search §5.2) - 2026-07-29-ai-trending-weekly.md(FutureAGI LLM Evaluation Frameworks §LLM Eval + Agent 评测缺口 57%/52% 邻接) - 2026-07-29T1505-jay-briefing-inference-rag-agent-mutlimodal-stack.md - 2026-07-29T1506-jay-five-category-briefing-p2.md(向量 DB benchmark 方法论陷阱 §1.2 + MC-Search §5.2 + SGLang vs vLLM benchmark §2.1)

flyp inbox (7-28下午~7-29): - 2026-07-29-1000-rss-cameron-wolfe.md(含 Agent 评估详细指南 + LLM Benchmark 剖析两个 eval 专项 RSS 引用) - 2026-07-29-1005-rss-interconnects.md(开源生态评估,无 eval 专项) - 2026-07-29-multimodal-e1prep.md(多模态专项,无 eval 专项)

spark inbox (7-28下午~7-29): - 2026-07-29-agent-e1prep.md(Lilian Weng Harness Engineering P0 立标 + evaluation 邻接覆盖)

stephen inbox (7-28下午~7-29): - 2026-07-29-ai-industry-e1prep.md(Anthropic 密码学弱点发现邻接 eval + HF 安全协作邻接) - 2026-07-29-1245-stephen-coordination-check-noon.md

paper_cards (618-634, 近 3 天新卡): - 严格抽查 17 张(618-634):主分类 evaluation:628(arXiv:2607.23402 Warp Divergence,✅)+ 631(arXiv:2607.22561 Codifying the Judge,✅) - 副分类 evaluation:618(arXiv:2607.24663 APS-RAG,副分类 evaluation) - 其余 14 张主分类:agent(634/629/627/626/625/623/622/620/619)+ rag(621)+ multimodal(632/633/634)+ engineering(624/622) - 近 3 天主分类 evaluation 新卡:2 件(Warp Divergence + Codifying the Judge)


主题活文档更新状态

  • knowledge/evaluation.md 当前版本:R29(2026-07-28 15:40 批次)
  • evaluation 活文档已 1 天未更新(R29 → R30 批次空缺;注:上一期 R29 本身由 7-28 evaluation e1prep 产出,R29 建卡时间应在 7-28 日间)
  • 本期 4 条增量(2 确认 + 2 邻接)可支持 R30 更新候选

Tom · 2026-07-29 15:40 CST | evaluation E1 预消化 | 2 确认 + 2 邻接 | 4 个可引用 arXiv 号