evaluation · E1 预消化简报(2026-09-26)

角色:Tom · E1 日间预消化轮(evaluation)· 窗口覆盖 2026-09-25 15:40 ~ 2026-09-26 15:40 CST 数据来源:Tom 9-25 evaluation e1prep(R85 基线)+ Jay 9-26 engineering e1prep + Jay 9-26T1050 eval/mcp substack + Jay 9-26T0820 csdn eval/graph + flyp 9-25 coding-agents/risk e1prep + stephen 9-26 ai-industry e1prep + Cool Papers RSS Sep 26 + paper_cards Sep 26 入库批次 + work-queue 9-26 10:00 活文档基线:evaluation.md R85 锚定(JEV-as-a-Judge 2609.26550 + Agensh 2609.26781 + Tri-PvP 2609.06011 + Calibration 2609.26489 + FLEET 2609.27657 + StudentBench 2609.28470 + NVIDIA Agent Eval + GameHorizon Suite 2609.25001 + Harness-Zero 2609.24974 + Mutation Analysis 2609.22220 + ACLArena 2609.23989 + Gricea 2609.22039 + CADWorld 2609.16251 + APort Vault 2609.22076 + SiliconBench 2609.19169 + SWE-bench-lite 2609.10451 + ReliabilityBench 2601.06112 + AutoTuneBench 2609.18123 ⚠paper_card 未入库 + AgentSysBench 2608.15127 ⚠paper_card 未入库 + EDGE-EVAL ⚠arXiv号待查)


0. 基线对齐与本轮概述

R85→R86 锚定状态: - R85 锚入的 3 件 eval 主分类 paper_card(Calibration 2609.26489 + FLEET 2609.27657 + StudentBench 2609.28470)本轮无状态更新 - R85 锚入的 JEV-as-a-Judge(2609.26550,paper_card 1487 ✓)本轮 HF 票数升至第四天在榜(连续第四天观测,具体票数待核实) - R85 锚入的 3 件 eval 待入库(AutoTuneBench 2609.18123 + AgentSysBench 2608.15127 + EDGE-EVAL)本轮仍无新进展 - ImpossibleRubrics vs MC-Search HAVE 框架矛盾本轮无新进展,保持 P0 开放问题标记 - JEV-as-a-Judge 与 Calibration 构成的"工程方案 + 制度框架"双锚本轮新增 JevOut + RLCDAlignBench 同源扩展

本轮 E1-R86 增量摘要: - 2 件 eval 主分类 paper_card 新入库(RGBD20K 2609.29028,evaluation 主分类 benchmark,160 细粒度类别大规模 RGB-D 分割 benchmark;Learning to Discover Interesting Mathematics 2609.28603,evaluation 主分类 method,定理有趣度量化) - 1 件 eval 邻接/副分类 paper_card 新入库(RLCDAlignBench 2609.29429,risk 主分类,eval 副分类,Jev 扩展 RLCD 校准决策,10 类对齐失败 benchmark) - 1 件 eval 邻接工程发现(JevOut 2609.30243,Cool Papers Sep 26,自然语境可翻转决策模型,与 JEV-as-a-Judge 同源) - 1 件 eval 邻接生产评估新信号(arXiv:2605.01604,Agentic AI 生产评估 7 failure modes,含 FM-5 Evaluation Harness Overfitting + FM-7 Proxy Goal Convergence) - 1 件 eval 邻接 RAG 评测新信号(CSDN RAG 检索质量评估 Hit Rate→LLM-as-Judge 校准,4 指标体系 + Ragas 集成) - ⚠️ 立标池 eval 相关结构性变化:JEV-as-a-Judge 第四天在榜(信号待核实)+ RLCDAlignBench 首次出现(risk/evaluation 双主分类,Jev 扩展)


1. 增量条目(5 件 eval 邻接/专项新信号)

增量 ① RGBD20K arXiv:2609.29028 · paper_card 1524 ✓ · Sep 26 入库 · evaluation 主分类 · benchmark 形态

  • 来源:paper_card 1524 ✓(Sep 26 入库,主分类 evaluation,形态 benchmark)+ work-queue 9-26 Top 0.5 + tom candidates 9-26
  • arXiv 号:arXiv:2609.29028 RGBD20K: A Large-Scale Benchmark for RGB-D Semantic Segmentation
  • 要点:
  • 核心问题:现有 RGB-D 语义分割 benchmark 类别多样性不足(NYUv2 仅 40 类,SUN RGB-D 仅 37 类),限制了模型的泛化性评测
  • RGBD20K 方案:160 个细粒度类别的大规模 RGB-D 语义分割 benchmark,大幅超越现有主流基准的类别多样性
  • 评测维度:RGB-D 语义分割的鲁棒性和泛化性
  • 与 R85 §4 维度化指标体系的关系:R85 锚入 Tri-PvP(模态偏差可归因性)+ JEV-as-a-Judge(置信度路由)+ FLEET(采样效率);RGBD20K 新增多模态分割鲁棒性评测维度,是垂直领域 benchmark 设计的 eval 方法学实例
  • 与活文档现有脉络的关系:R85 §4 维度化指标体系(Tri-PvP 模态偏差 + JEV 置信度路由);RGBD20K 是 eval 方法学在 RGB-D 视觉领域的具体 benchmark 实现,与 Tri-PvP(语言模态冲突)构成不同模态/任务的评测设计对照
  • 建议归入节:evaluation.md §4 维度化指标体系(RGBD20K 作为多模态分割鲁棒性 benchmark 候选)+ §7.3 开放问题(垂直领域 benchmark 的评测设计方法学迁移价值)
  • 可信度:⭐⭐⭐(paper_card 1524 ✓ Sep 26 当日入库 + eval 主分类 + benchmark 形态 + work-queue Top 0.5;但 TLDR 截断,具体实验数据待核实)
  • ⚠️ 待核实:160 类与 NYUv2/SUN RGB-D 的具体对比数字;RGBD20K 在 160 类上的具体评测结果;与现有 RGB-D benchmark(SimMC3 等)的关系

增量 ② Learning to Discover Interesting Mathematics arXiv:2609.28603 · paper_card 1526 ✓ · Sep 26 入库 · evaluation 主分类 · method 形态

  • 来源:paper_card 1526 ✓(Sep 26 入库,主分类 evaluation,形态 method)+ tom candidates 9-26
  • arXiv 号:arXiv:2609.28603 Learning to Discover Interesting Mathematics
  • 要点:
  • 核心问题:LLM 越来越多地能够猜想并证明定理,但这些新数学知识是否有趣/有用仍是开放问题
  • 核心方案:将定理的内在有趣度定义为"证明长度与陈述长度之比"(proof length / statement length ratio);该指标与下载量的外在度量高度相关
  • 评测方法学意义:首次提出定理有趣度的可量化评测标准——将"有趣/有用"这一主观评价转化为可测量的 ratio 指标;为 AI 数学发现能力提供了量化评测路径
  • 新维度:AI 生成内容的"有趣度"评测维度首次被量化提出
  • 与活文档现有脉络的关系:R85 §4 维度化指标体系(FLEET 采样效率 + Tri-PvP 模态偏差);Learning to Discover Interesting Mathematics 新增生成内容质量-价值评测维度,与 FLEET 的"采样效率"构成不同维度的内容质量评测对照
  • 建议归入节:evaluation.md §4 维度化指标体系(定理有趣度 ratio 作为内容价值评测候选)+ §7.3 开放问题(有趣度 ratio 向其他领域迁移的可能性)
  • 可信度:⭐⭐⭐(paper_card 1526 ✓ Sep 26 当日入库 + eval 主分类 + method;proof/statement ratio 有具体定义,但需全文核实与其他人类数学家的对比数据)
  • ⚠️ 待核实:proof/statement ratio 的具体阈值定义;与人类数学家发现定理有趣度的对比;该 ratio 是否泛化到其他领域(代码/证明/科学假设)

增量 ③ RLCDAlignBench arXiv:2609.29429 · paper_card 1521 ✓ · Sep 26 入库 · risk 主分类 · eval 副分类 · Jev RLCD 扩展 · 10 类对齐失败 benchmark

  • 来源:paper_card 1521 ✓(Sep 26 入库,主分类 risk,副分类 evaluation,形态 benchmark)+ tom candidates 9-26
  • arXiv 号:arXiv:2609.29429 Just Ask Jev: Reinforcement Learning for Calibrated Decisions as a Zero-Shot Detector of AI Alignment Failures
  • 要点:
  • 核心问题:Jev 是一个通过校准决策强化学习(RLCD)训练的模型,可在单次调用中以校准概率回答针对同一输入的多类型问题;其能否检测对齐失败尚未得到度量
  • RLCDAlignBench 方案:在 10 类对齐失败场景上对 Jev 进行基准评测,包括:谄媚(sycophancy)等
  • 技术基础:Jev 的 RLCD 方法——与 JEV-as-a-Judge(2609.26550)同源,RLCD 是 Jev 的训练方法,JEV-as-a-Judge 是其应用框架
  • 与 JEV-as-a-Judge 的关系:JEV-as-a-Judge 是 decision-only judge 的置信度路由方案;RLCDAlignBench 是对 Jev 模型本身在 10 类对齐失败场景下的能力评测;两者是同一研究线的两个维度(应用框架 vs 能力验证)
  • 方法学意义:首次提供"校准决策作为对齐失败零样本检测器"的系统性 benchmark;回答了 R85 §7.3 开放问题"JEV-as-a-Judge 置信度路由的校准良好性是否实证"
  • 与活文档现有脉络的关系:R85 §3.3(JEV-as-a-Judge + Calibration 构成"工程方案 + 制度框架"双锚);RLCDAlignBench 新增Jev 对齐失败检测能力的系统性验证,与 JEV-as-a-Judge 构成"能力验证 + 应用框架"同源双锚
  • 建议归入节:evaluation.md §3.3(JEV-as-a-Judge 同源扩展,RLCDAlignBench 作为 Jev 对齐检测能力验证)+ §7.3 开放问题(Jev RLCD 校准性与 Calibration 制度性框架的对应关系)
  • 可信度:⭐⭐⭐⭐(paper_card 1521 ✓ Sep 26 当日入库 + risk 主分类 eval 副分类 + Jev 同源 + 10 类对齐失败 benchmark 具体;risk 主分类可能影响 eval 专项信号强度)
  • ⚠️ 待核实:10 类对齐失败的具体列表;RLCDAlignBench 在 10 类上的具体检测准确率;Jev 与 Llama Guard 等分类器的对比数据

增量 ④ JevOut arXiv:2609.30243 · Cool Papers Sep 26 · 自然语境可翻转决策模型 · JEV 同源

  • 来源:Cool Papers RSS Sep 26(papers.cool cs.CL)+ tom candidates 9-26
  • arXiv 号:arXiv:2609.30243 JevOut: Natural Context Can Flip Decision Models
  • 要点:
  • 核心发现:Jev 等专用决策模型将非结构化语言映射到有限选项上的概率分布;自然语境(natural context)可以翻转(flip)决策模型的输出——即输入的语境变化可以导致原本稳定的决策发生逆转
  • 技术意义:揭示了决策模型对输入语境的敏感性——这与 JEV-as-a-Judge 的置信度路由机制直接相关:当自然语境可以翻转决策时,judge 的置信度判断本身也可能是语境敏感的
  • 与 JEV-as-a-Judge 的关系:JEV-as-a-Judge 提供了决策型 judge + 置信度路由;JevOut 揭示了决策模型(包括 Jev)面临"语境翻转"风险——这与 Calibration 论文的"校准失当"问题构成不同角度的"决策可靠性"挑战
  • 评测方法学意义:JevOut 为 eval 中的 judge 可靠性提供了新的测试维度——语境翻转敏感性应当成为 judge 评测的一部分
  • 与活文档现有脉络的关系:R85 §3.3(JEV-as-a-Judge + Calibration 构成"工程方案 + 制度框架"双锚);JevOut 新增决策模型语境翻转敏感性评测维度,与 Calibration 的"校准失当"和 JEV-as-a-Judge 的"置信度路由"共同构成"决策可靠性三角"
  • 建议归入节:evaluation.md §3.3(JevOut 作为 JEV-as-a-Judge 语境翻转风险标注)+ §7.3 开放问题(JevOut 语境翻转与 Calibration adoption gap 的交叉影响)
  • 可信度:⭐⭐⭐(Cool Papers Sep 26 有标题和摘要;JevOut 与 JEV-as-a-Judge 同源,方法学逻辑连贯;但具体实验数据待核实)
  • ⚠️ 待核实:自然语境翻转决策的具体案例和比例;JevOut 测试了多少种语境变化;语境翻转是否在 JEV-as-a-Judge 的置信度路由机制中被考虑

增量 ⑤ Agentic AI 生产评估 7 Failure Modes arXiv:2605.01604 · Jay 9-26 engineering e1prep · 含 FM-5 Evaluation Harness Overfitting + FM-7 Proxy Goal Convergence

  • 来源:jay 9-26T1050-inference-agent-eval-mcp-substack-sep26.md(T0-4)+ Jay 9-26 engineering e1prep(§增量 7)+ Mukund Pandey arXiv:2605.01604
  • arXiv 号:arXiv:2605.01604 Agentic AI 生产评估:7 个生产独有失败模式
  • 要点:
  • 7 个生产 agentic 系统独有失败模式(生产 grounded):
    • FM-1: Compounding Decision Errors(决策误差累积)
    • FM-2: Tool Failure Cascades(工具故障级联)
    • FM-3: Non-deterministic Output Drift(非确定性输出漂移)
    • FM-4: Long-horizon Ground Truth Absence(长时域无真值)
    • FM-5: Evaluation Harness Overfitting(评估框架过拟合) ← eval 直接相关
    • FM-6: Silent Degradation in Production(生产静默退化)
    • FM-7: Proxy Goal Convergence(代理目标收敛) ← eval 直接相关
  • FM-5 评估框架过拟合:现有 benchmark(HELM/MT-Bench/AgentBench/BIG-bench)均针对单次会话,无法覆盖生产连续运行场景——导致 agent 在 benchmark 上过拟合但在生产中失败
  • FM-7 代理目标收敛:LLM-as-Judge 在长时域任务中表现不足——judge 自身成为性能瓶颈
  • 关键结论:实证证明标准指标(ROUGE/BERT/AUC)无法检测生产漂移;多目标监控 + counterfactual evaluation 可检测 FM-7
  • 与活文档现有脉络的关系:R85 §3.3(JEV-as-a-Judge 置信度路由 + Calibration 校准一等标准);FM-5(评估框架过拟合)与 R85 锚入的 Model or Harness?(2607.28802)构成不同角度的"harness 过拟合"问题;FM-7(代理目标收敛)与 JEV-as-a-Judge 构成"judge 局限性"的双重发现
  • 建议归入节:evaluation.md §3.3(FM-5 评估框架过拟合作为 harness 过拟合问题的新证据)+ §7.3 开放问题(FM-7 与 JEV-as-a-Judge 在长时域任务中 judge 局限性的交叉验证)
  • 可信度:⭐⭐⭐⭐(arXiv:2605.01604,2026-05-02 发布,生产数据驱动,7 个 failure modes 含具体描述,有参考实现)
  • ⚠️ 待核实:FM-5 评估框架过拟合的具体案例;FM-7 代理目标收敛的量化数据;counterfactual evaluation 的具体实施方法

2. Sep 25-26 paper_cards eval 相关新卡核查

Sep 25-26 eval 主分类卡(2 件)

编号 arXiv 标题 主分类 状态
1524 2609.29028 RGBD20K: A Large-Scale Benchmark for RGB-D Semantic Segmentation evaluation Sep 26 入库 · benchmark · work-queue Top 0.5 · ⭐⭐⭐
1526 2609.28603 Learning to Discover Interesting Mathematics evaluation Sep 26 入库 · method · 定理有趣度量化 · ⭐⭐⭐

Sep 25-26 eval 邻接/副分类卡(2 件)

编号 arXiv 标题 主分类 eval 关系
1521 2609.29429 RLCDAlignBench: Just Ask Jev risk eval 副分类(10 类对齐失败 benchmark · Jev 同源 · ⭐⭐⭐⭐)
1511 2609.29444 IterSynth: Role-Decoupled Iterative Synthesis agent eval 邻接(role-decoupled synthesis · Deep Search Agent · R85 已锚)

Sep 23-25 eval 主分类卡沿用(3 件,R85 锚入)

编号 arXiv 标题 主分类 状态
1504 2609.26489 Calibration as a First-Class Criterion in LLM Evaluation evaluation Sep 25 入库 · benchmark · work-queue Top 0.5(R85 锚入)
1500 2609.27657 FLEET: From Logits Entropy to Enhanced Trajectories evaluation Sep 25 入库 · method · HF 2▲(R85 锚入)
1496 2609.28470 StudentBench: AI and Human Tutoring evaluation Sep 24 入库 · method(R85 锚入)

3. 矛盾与待核实

矛盾 ① ⚠⚠ ImpossibleRubrics vs MC-Search HAVE 框架 —— R80 提出,本轮无新进展

  • 状态:R80 提出的方法学层面系统性冲突,本轮 inbox 来源中未出现新进展或交叉核实
  • 建议:§7.3 开放问题保持 P0 标记,R87 前需完成实测交叉核实

矛盾 ② ⚠ JevOut 自然语境翻转 vs JEV-as-a-Judge 置信度路由的可靠性

  • 状态:R86 本轮新增;JevOut(2609.30243)揭示自然语境可翻转决策模型输出,与 JEV-as-a-Judge 的置信度路由机制构成"路由是否也被语境翻转"的开放问题
  • 建议:§7.3 开放问题新增 JevOut 语境翻转与置信度路由的交叉影响问题

待核实 ①:AutoTuneBench 2609.18123 paper_card 入库状态(R80 提出,本轮无进展)

  • 本轮状态:仍未入库;work-queue 9-26 10:00 仍无该 paper_card 预警
  • 建议:evaluation.md §3.3 保持 ⚠️ paper_card 未入库标注

待核实 ②:AgentSysBench 2608.15127 paper_card 入库状态(R80 提出,本轮无进展)

  • 本轮状态:仍未入库
  • 建议:evaluation.md §3.3 保持 ⚠️ paper_card 未入库标注

待核实 ③:EDGE-EVAL 具体 arXiv 号(R80 提出,本轮无进展)

  • 本轮状态:仍未出现;arXiv 号缺失
  • 建议:入库时补充具体 arXiv 号

待核实 ④:Anthropic + Accenture 嵌入式评估具体方法学(R81 提出,本轮无实质进展)

  • 本轮状态:Stephen 9-26 ai-industry e1prep 仍沿用公告层面;OpenAI frontier lab 评测公开化国际维本轮无更新
  • 建议:§3.3 候选标注 ⚠️ 详细内容待核实

待核实 ⑤:Harness-Zero 全文量化数据(R83 提出,本轮无进展)

  • 本轮状态:TLDR 截断;Harness 增益保留率、训练数据规模、算力开销、泛化性边界均未给出
  • 建议:§3.3 候选标注 ⚠️ 全文 §4 实验节待核

待核实 ⑥:JEV-as-a-Judge 全文量化数据(R84 提出,本轮无进展)

  • 本轮状态:TLDR 截断;多步推理链任务中 3% 差距扩大问题;置信度路由不确定性度量校准方法;第三方独立 benchmark 状态;第四天在榜(票数待核实)
  • 建议:§2.1 候选标注 ⚠️ 全文待核;关注第四天 HF 票数

待核实 ⑦:RRSI 154▲ #1 立标极显著性独立核验(R83 提出,⚠⚠⚠⚠⚠ 本轮第五轮仍未独立核验)

  • 本轮状态:RRSI(arXiv:2609.24972)本轮未入 HF Daily Top15;Stephen 9-26 ai-industry e1prep 仍未独立核验
  • 建议:§3.5 候选标注 ⚠️ 连续五轮未核验,R87 前需下决心降级或独立核实

待核实 ⑧:RLCDAlignBench 10 类对齐失败具体列表(R86 本轮新增,本轮首次提出)

  • 本轮状态:paper_card 1521 ✓ Sep 26 入库提供 TLDR;10 类对齐失败包括谄媚(sycophancy),但具体其余 9 类未知
  • 建议:§3.3 候选标注 ⚠️ 需核实 10 类完整列表和具体检测准确率

待核实 ⑨:JevOut 自然语境翻转具体机制和比例(R86 本轮新增,本轮首次提出)

  • 本轮状态:Cool Papers Sep 26 有标题和摘要;具体实验数据未知
  • 建议:§3.3 候选标注 ⚠️ 需核实具体案例和比例

4. Sep 25-26 立标池 eval 相关结构性变化

4.1 JEV-as-a-Judge 第四天在榜(信号待核实)

  • JEV-as-a-Judge(2609.26550):9-22 18▲ → 9-24 18▲ → 9-25 26▲ → 9-26 第四天在榜(票数待核实) ——eval 方法学论文第四天持续在榜,信号持续稳定

4.2 RLCDAlignBench 首次出现(eval 邻接新信号)

  • RLCDAlignBench(2609.29429):Sep 26 paper_card 1521 ✓ 入库 ——Jev RLCD 扩展,10 类对齐失败 benchmark,risk 主分类/eval 副分类,JEV-as-a-Judge 同源

4.3 Atria Dawn 连续第十日跌出(⚠⚠⚠⚠⚠⚠)

  • 跌出轨迹:9-17 424▲ #1 → 9-18~9-26 连续第十日未入 Top15 ⚠⚠⚠⚠⚠⚠
  • ⚠ 重要警示:R78-R86 以来 Atria Dawn 最长跌出纪录持续扩大;与 flyp 的"评估污染 + 票数真实性"6 项反方证据共同构成元评测层面的持续性批判

5. 可引用 arXiv 号列表

本轮 eval 主分类新入库(2 件): - arXiv:2609.29028 — RGBD20K(paper_card 1524 ✓ · eval 主分类 · benchmark · 160 类细粒度 RGB-D 分割 · work-queue Top 0.5 · ⭐⭐⭐) - arXiv:2609.28603 — Learning to Discover Interesting Mathematics(paper_card 1526 ✓ · eval 主分类 · method · 定理有趣度量化 ratio · ⭐⭐⭐)

本轮 eval 邻接/副分类新入库(2 件): - arXiv:2609.29429 — RLCDAlignBench(paper_card 1521 ✓ · risk 主分类/eval 副分类 · Jev RLCD · 10 类对齐失败 benchmark · ⭐⭐⭐⭐) - arXiv:2609.30243 — JevOut(Cool Papers Sep 26 · JEV 同源 · 自然语境可翻转决策模型 · ⭐⭐⭐)

本轮 eval 邻接工程/方法学新增(1 件): - arXiv:2605.01604 — Agentic AI 生产评估 7 Failure Modes(Jay 9-26T1050 T0-4 · FM-5 评估框架过拟合 + FM-7 代理目标收敛 · ⭐⭐⭐⭐)

R85 沿用 eval 专项/邻接(19 件): - arXiv:2609.26550 — JEV-as-a-Judge(paper_card 1487 ✓ · eval 主分类 · method · HF 第四天在榜 · ⭐⭐⭐⭐) - arXiv:2609.26781 — Agensh(paper_card 1486 ✓ · eval 副分类 · 1,024 agents 无中心编排器 harness · ⭐⭐⭐⭐) - arXiv:2609.06011 — Tri-PvP(paper_card 1491 ✓ · eval 副分类 · 8000 样本三模态冲突 benchmark · ⭐⭐⭐) - arXiv:2609.26489 — Calibration as a First-Class Criterion in LLM Evaluation(paper_card 1504 ✓ · eval 主分类 · benchmark · work-queue Top 0.5 · ⭐⭐⭐⭐) - arXiv:2609.27657 — FLEET: From Logits Entropy to Enhanced Trajectories(paper_card 1500 ✓ · eval 主分类 · method · HF 2▲ · ⭐⭐⭐) - arXiv:2609.28470 — StudentBench: AI and Human Tutoring(paper_card 1496 ✓ · eval 主分类 · method · 175,000 messages · ⭐⭐⭐) - arXiv:2609.25001 — GameHorizon Suite(paper_card 1456 ✓ · HF 115▲ #3 · multi-horizon gameplay benchmark · ⭐⭐⭐⭐) - arXiv:2609.24974 — Harness-Zero(paper_card 1458 ✓ · eval 主分类 · TLDR 截断待全文 · ⭐⭐⭐) - arXiv:2609.22220 — Mutation Analysis for GPU-Kernel Benchmark Oracles(paper_card 1463 ✓ · benchmark · oracle adequacy metric · ⭐⭐⭐) - arXiv:2609.23989 — ACLArena(paper_card 1469 ✓ · ACL 评测框架 · model-level + token-level 双视角 · ⭐⭐⭐) - arXiv:2609.22039 — Gricea(paper_card 1449 ✓ · 开放科学 CAI 平台 · HF 7 票 · ⭐⭐⭐⭐) - arXiv:2609.16251 — CADWorld(paper_card 1453 ✓ · FreeCAD 200 tasks × 11 · ⭐⭐⭐⭐) - arXiv:2609.22076 — APort Vault(paper_card 1444 ✓ · 225,964 次评测 · HF 2 票 · ⭐⭐⭐) - arXiv:2609.19169 — SiliconBench(paper_card 1454 ✓ · Apple Silicon serving 三维度 · ⭐⭐⭐) - arXiv:2609.10451 — SWE-bench-lite XAgent 62%(coding agent 标准尺 · 13.86%→62% vs 80% · ⭐⭐⭐⭐) - arXiv:2601.06112 — ReliabilityBench(chaos engineering · 1,280 场景 · 96.9%→88.1% · ⭐⭐⭐) - arXiv:2609.18123 — AutoTuneBench(⚠️ paper_card 未入库 · ⭐⭐⭐⭐) - arXiv:2608.15127 — AgentSysBench(⚠️ paper_card 未入库 · 178,799 sessions · ⭐⭐⭐⭐) - arXiv:2603.00873 — MC-Search(ICLR 2026 ✓ · Agentic MM-RAG 过程级基准 · ⭐⭐⭐⭐)

R85 沿用 eval 方法学锚(5 件): - arXiv:2609.20804 — Coding Agent Harness Design(HF 71▲ #7 后跌出 · ⭐⭐⭐⭐) - arXiv:2609.18605 — PACT(paper_card 1417 ✓ · 企业合规 · ⭐⭐⭐⭐) - arXiv:2609.17496 — Fuse(paper_card 1433 ✓ · 可验证社交推理 · HF 51▲ · ⭐⭐⭐⭐) - arXiv:2609.18323 — MiniMax-H3(paper_card 1429 ✓ · 517 instances × 4 维度 · HF 116▲ #2 · ⭐⭐⭐⭐) - EDGE-EVAL — ACL Anthology 2026(⚠️ arXiv 号待查 · ⭐⭐⭐)

本轮 R86 立标池 eval 相关新增候选: - arXiv:2609.24972 — RRSI(⚠️ 154▲ #1 立标极显著但仅一家给出 · Agent Harness 正则化递归自我改进 · ⭐⭐⭐ · 连续五轮未独立核验 ⚠⚠⚠⚠⚠)


6. 增量条数汇总

类别 条数 编号
eval 主分类新入库 2 ① RGBD20K(2609.29028,paper_card 1524 ✓,eval 主分类,benchmark,160 类细粒度 RGB-D 分割,work-queue Top 0.5)+ ② Learning to Discover Interesting Mathematics(2609.28603,paper_card 1526 ✓,eval 主分类,method,定理有趣度量化)
eval 邻接新入库 3 ③ RLCDAlignBench(2609.29429,paper_card 1521 ✓,risk/eval 双主分类,Jev RLCD,10 类对齐失败 benchmark)+ ④ JevOut(2609.30243,Cool Papers Sep 26,JEV 同源,自然语境可翻转决策模型)+ ⑤ arXiv:2605.01604(Agentic AI 生产评估 7 failure modes,含 FM-5 评估框架过拟合 + FM-7 代理目标收敛)
合计净增量 5 ①-⑤

arXiv 号数量:2 件本轮 eval 主分类 + 2 件本轮 eval 邻接入库 + 1 件本轮 eval 邻接工程新增 + 19 件 R85 沿用 + 5 件 R85 沿用方法学锚 + 1 件立标候选 = 30 件


7. 检查过的来源清单

# inbox/tom/
2026-09-25-evaluation-e1prep.md R85(完整基线)
2026-09-26-0900-hf-daily-2026-09-26.md(HF Daily Sep 26)
2026-09-26-agent-rag-longcontext-radar.md(候选承接)
2026-09-26-rag-e1prep.md(邻接)

# inbox/jay/
2026-09-26T1050-jay-inference-agent-eval-mcp-substack-sep26.md(T0-4 arXiv:2605.01604 Agentic AI 生产评估 7 failure modes)
2026-09-26T0820-jay-csdn-rag-vecdb-eval-graph-highvalue-sep26.md(RAG 检索 Hit Rate→LLM-as-Judge 校准 · CSDN T0 高价值)
2026-09-26-engineering-e1prep.md(§增量 7 arXiv:2605.01604)
2026-09-26-1001-rss-lilian-weng.md(邻接 · 无 eval 专项信号)
2026-09-25-engineering-e1prep.md R85(锚定基线)

# inbox/flyp/
2026-09-25-coding-agents-e1prep.md(§增量 5 Calibration + FLEET + Capable yet Parsimonious 评测方法学第八元组承接)
2026-09-25-risk-e1prep.md(Calibration 评测方法学 26 维预备候选)

# inbox/stephen/
2026-09-26-ai-industry-e1prep.md(立标池结构性洗牌第 10 次预备触发 + Multi-Agent Harness 生态成形)

# paper_cards/
1524-2609-29028.md(RGBD20K · eval 主分类 · benchmark · Sep 26 入库)
1526-2609-28603.md(Learning to Discover Interesting Mathematics · eval 主分类 · method · Sep 26 入库)
1521-2609-29429.md(RLCDAlignBench · risk/eval 双主分类 · Sep 26 入库)
1487-2609-26550.md(JEV-as-a-Judge · eval 主分类 · HF 第四天在榜待核实)
1504-2609-26489.md(Calibration · eval 主分类 · R85 锚入)
1500-2609-27657.md(FLEET · eval 主分类 · R85 锚入)
1496-2609-28470.md(StudentBench · eval 主分类 · R85 锚入)
1511-2609-29444.md(IterSynth · agent 主分类 · eval 邻接 · R85 已锚)

# Cool Papers RSS Sep 26
JevOut: Natural Context Can Flip Decision Models(arXiv:2609.30243)

# work-queue/
2026-09-26 10:00(RGBD20K 2609.29028 Top 0.5)

8. 无显著新增量时的如实说明

本轮 eval 领域有实质增量:2 件 eval 主分类 paper_card 入库(RGBD20K 2609.29028 160 类细粒度 RGB-D 分割 benchmark + Learning to Discover Interesting Mathematics 2609.28603 定理有趣度量化)+ 1 件 eval 邻接/副分类入库(RLCDAlignBench 2609.29429 Jev RLCD 扩展 10 类对齐失败 benchmark)+ 1 件 eval 邻接工程发现(JevOut 2609.30243 自然语境可翻转决策模型)+ 1 件 eval 邻接生产评估(arXiv:2605.01604 Agentic AI 7 failure modes 含 FM-5/FM-7)——信号密度低于 R85 的 3 件 eval 主分类,但 RLCDAlignBench + JevOut 提供了 JEV-as-a-Judge 同源扩展的"能力验证"维度,与 Calibration 制度框架 + JEV 应用框架构成三角结构。

信号质量评估: - RLCDAlignBench(2609.29429)是本轮最高价值 eval 邻接入库,paper_card 1521 ✓ Sep 26 当日入库,Jev 同源,10 类对齐失败 benchmark,risk 主分类/eval 副分类;首次提供 Jev 对齐失败检测能力的系统性验证,与 JEV-as-a-Judge 构成"能力验证 + 应用框架"同源双锚 - JevOut(2609.30243)Cool Papers Sep 26,JEV 同源;揭示自然语境可翻转决策模型,与 JEV-as-a-Judge 置信度路由构成新的开放问题(路由是否也被语境翻转) - RGBD20K(2609.29028)paper_card 1524 ✓ Sep 26 当日入库,work-queue Top 0.5;160 类细粒度 RGB-D 分割 benchmark,扩展了多模态分割鲁棒性评测维度 - Learning to Discover Interesting Mathematics(2609.28603)paper_card 1526 ✓ Sep 26 当日入库;首次提出定理有趣度的可量化评测标准(proof/statement ratio),扩展了内容质量-价值评测维度 - arXiv:2605.01604(Agentic AI 生产评估 7 failure modes)是 eval 邻接的实用工程论文,FM-5(评估框架过拟合)与 Model or Harness?构成不同角度的 harness 过拟合问题;FM-7(代理目标收敛)与 JEV-as-a-Judge 构成"judge 局限性"双重发现 - RRSI(2609.24972)连续第五轮未独立核验,⚠⚠⚠⚠⚠ 需 R87 前做出降级决定 - Atria Dawn 连续第十日跌出 Top15,创 R78-R86 以来最长跌出纪录

R86 活文档建议关注:① RLCDAlignBench 10 类对齐失败完整列表和检测准确率;② JevOut 自然语境翻转具体机制和比例;③ JEV-as-a-Judge 第四天 HF 票数(是否持续稳定或衰减);④ FM-5/FM-7 与 JEV-as-a-Judge + Calibration 的交叉验证;⑤ RGBD20K 160 类具体对比数字;⑥ Learning to Discover Interesting Mathematics proof/statement ratio 的具体阈值和泛化性


Tom · 2026-09-26 15:40 CST · E1 预消化 · evaluation · R86 窗口覆盖完成 · 2 件 eval 主分类新入库(RGBD20K 2609.29028 paper_card 1524 ✓ + Learning to Discover Interesting Mathematics 2609.28603 paper_card 1526 ✓)+ 1 件 eval 邻接/副分类新入库(RLCDAlignBench 2609.29429 paper_card 1521 ✓ Jev RLCD 扩展)+ 1 件 eval 邻接工程发现(JevOut 2609.30243 Cool Papers Sep 26 自然语境翻转)+ 1 件 eval 邻接生产评估(arXiv:2605.01604 Agentic AI 7 failure modes 含 FM-5/FM-7)+ ⚠️ RRSI 连续第五轮未独立核验 + ⚠️ Atria Dawn 连续第十日跌出