evaluation · E1 预消化简报(2026-09-16)

角色: Tom · E1 日间预消化轮(evaluation)· 窗口覆盖 2026-09-15 15:40 ~ 2026-09-16 15:40 CST 数据来源: Tom 9-15 evaluation e1prep 基线 + Tom 9-16 0840 radar + HF Daily 9-16 + spark 9-16 agent e1prep + Jay 9-16 csdn/arxiv + Stephen 9-16 ai-industry e1prep + paper_cards Sep 14-16 新卡核查 + work-queue 9-16 14:00 活文档基线: evaluation.md R75 锚定(VDiff-Bench 2609.06245 + IdeaAMBIG 2609.10539 + MetroLLM-Bench 2609.10016 + EvoSafeHarness 2609.05903 + SWE-Bench Pro Verified 2609.08149 + Diffs vs. Whole Files 2609.05779 + WearableQA 2609.05405 + DCP 2609.09219 + SAEScientist-Bench 2609.09113 + AgentAudit 2609.09875 + EVOHarnessBENCH 2609.04280 + Closing Consistency Gap 2609.08832 + Benchmark Radar 2609.11115 + DataFlex-RL 2609.06107 + LHTB 2607.08964)


0. 基线对齐与本轮概述

R75→R76 锚定状态: - 14 件 eval 专项/邻接(R75 已锚): VDiff-Bench(2609.06245)+ IdeaAMBIG(2609.10539)+ MetroLLM-Bench(2609.10016)+ EvoSafeHarness(2609.05903)+ SWE-Bench Pro Verified(2609.08149)+ Diffs vs. Whole Files(2609.05779)+ WearableQA(2609.05405)+ DCP(2609.09219)+ SAEScientist-Bench(2609.09113)+ AgentAudit(2609.09875)+ EVOHarnessBENCH(2609.04280)+ Closing Consistency Gap(2609.08832)+ Benchmark Radar(2609.11115)+ DataFlex-RL(2609.06107)+ LHTB(2607.08964) - Compile by Training(2609.04199)R75 正式降级为"已沉寂"(连续 9 日无 HF 记录)

本轮 E1-R76 增量摘要: - 信号持续低谷期确认:本轮 eval 专项净新增 0 件 paper_card(Sep 14-16 无 eval 主分类新卡入库);eval 邻接净新增 2 件 paper_card(E2A-Bench 2609.14302 + Thought without systematicity? 2609.13948),但两者 work-queue 均标为高价值待深度解读,尚未入库 - 1 件 eval 邻接 paper_card 新入库: Model or Harness Failure Taxonomy(2607.28802,paper_card 726 主分类 engineering 副分类 agent,Scale AI 出品,flyp critical-read ★★★★) - DataFlex-RL HF 票数下滑:96▲(Sep 15 #3)→ 110▲(Sep 16 #6)= +14▲ 票数增长但排名从 #3 降至 #6,新进条目挤压排名 - Benchmark Radar 退出 Top15:Sep 15 同日两次出现(80▲ + 75▲)后,Sep 16 未出现 Top15 - eval 相关条目 HF Top15 信号整体横盘:Sep 15 集体退出后,Sep 16 无 eval 邻接条目新入 Top15 - 整体判断: Sep 15-16 eval 信号密度处于 R75 以来最低水平——0 件 eval 专项 net-new paper_card,仅 2 件 eval 主分类新卡(均未入库)且 work-queue 标注为高价值待深度解读(说明尚未完成内部审核)


1. 增量条目(2 件 eval 主分类新卡 + 1 件 eval 邻接新锚 + 3 件信号消散/退出确认)

增量 ① E2A-Bench(arXiv:2609.14302):金融图表证据-行动可靠性评测基准,work-queue Top15 高价值

  • 来源: Tom 9-16 0840 radar 候选条目 + paper_card 1377(9-16 14:10 入库,主分类 evaluation)+ work-queue 9-16 14:00 Top15 高价值待深度解读(#3)+ spark 9-16 agent e1prep 承接
  • 要点:
  • E2A-Bench:金融图表推理中证据到行动可靠性的基准测试,969 query,323 只 HS300 成份股,三种输入模态,OHLCV 衍生的确定性证据锚点
  • 评估维度:grounding(证据追溯)+ reasoning-action consistency(推理-行动一致性)+ evidence-confidence calibration(证据-置信度校准)
  • 核心问题:现有幻觉评估大多以声明为中心,判断生成的陈述是否有证据支持,但不评估证据能否在推理过程、置信度与最终行动中保持可追溯——E2A-Bench 填补了这一空白
  • 金融场景特殊性:HS300 成分股 + OHLCV 确定性锚点 = 可验证的客观评测环境,而非开放式文本生成评估
  • 与 RAG 域的交叉:E2A-Bench 是 RAG 系统在金融垂直域端到端评测的量化基准,与 R91 §2.13 的 CiteGuard-RAG(2609.15830)形成"通用引用验证 + 垂直金融行动可靠性"双轨
  • 与活文档现有脉络的关系: R75 中 E2A-Bench 已在 RAG pre-digest 中作为邻接条目出现,但本次 paper_card 1377 确认主分类为 evaluation;与 §2.13 Evaluation & Benchmark 直接相关——是垂直领域 RAG 评测的量化基准;与 R75 Benchmark Radar(元评测基础设施)形成"具体 task benchmark + meta benchmark platform"的互补关系
  • 建议归入节: §2.13 Evaluation & Benchmark(E2A-Bench 金融图表证据-行动评测)+ §2.7 多模态 RAG(金融垂直域)
  • 可信度: ★★★(paper_card 1377 ✓;work-queue Top15 高价值标注;arXiv 2609.14302;具体 benchmark 数字需读全文)
  • ⚠️ 待核实: E2A-Bench 与现有金融 RAG 评测(Financelens 等)的关系;969 query 的评测结果分布;代码/数据是否公开

增量 ② Thought without systematicity?(arXiv:2609.13948):规则归纳任务评估推理模型系统性,eval 主分类 position paper

  • 来源: Tom 9-16 0840 radar 候选条目 + paper_card 1378(9-16 14:10 入库,主分类 evaluation)+ work-queue 9-16 14:00 Top15 高价值待深度解读(#2)
  • 要点:
  • 核心问题:人类认知的核心原则是系统性(systematicity)——理解一个概念本质上与理解其相近变体相关联。推理模型能否稳健地展现这种系统性?
  • 方法:扩展认知科学中既定的规则归纳任务,创建结构等价的任务变体(task isomorphisms),评估模型在结构等价变体上是否表现一致
  • position paper 形态:方法学论文而非数据集或系统,侧重于提出评估框架和论证系统性评估的必要性
  • eval 意义:在推理模型大放异彩的背景下,系统性(systematicity)是认知科学对"泛化能力"的核心定义,对应了当前 LLM benchmarks 忽视的盲点——模型可能在特定任务上表现出色,但在结构等价变体上失败
  • 与活文档现有脉络的关系: R75 §4 维度化指标体系(推理能力系统性评测维度缺失);R75 §6.133 候选区(Eval 领域基础方法学研究);与 VDiff-Bench(R75 锚入)同属推理评测方向,但 VDiff-Bench 关注视觉diff,Thought without systematicity? 关注规则归纳系统性
  • 建议归入节: §4 维度化指标体系(推理系统性评测维度)+ §6.133 候选区(认知科学方法学引入推理评测)
  • 可信度: ★★★(paper_card 1378 ✓;work-queue Top15 高价值标注;position paper 方法学贡献需读全文确认)
  • ⚠️ 待核实: 论文是否提供具体评测结果还是纯论证;task isomorphisms 的具体构造方式;与现有 reasoning 评测(MMLU/HumanEval 等系统性分析)的关系

增量 ③ Model or Harness Failure Taxonomy(arXiv:2607.28802):Scale AI 出品,Agent 失败归因 41 类 × interaction edge,flyp critical-read ★★★★

  • 来源: spark 9-16 agent e1prep 增量 1 + flyp 9-15 2250 critical-read ★★★★ + paper_card 726(主分类 engineering 副分类 agent)+ work-queue 未单独列出但在 spark 协调棒中确认
  • 要点:
  • 核心贡献:8 类 component × 41 个 failure mode × 双向 edge × fault side(model / owner / harness / tool / memory / environment / grader / third party)
  • 关键创新:失败定位于 interaction edge(两个 component 之间)而不是组件本身;只标"earliest unrecovered failure",不标下游症状
  • 修复动作分类:post-training / harness engineering / environment redesign / benchmark repair
  • 跨模型验证:4 个 frontier model 当 LLM-as-judge 独立标注,κ=0.76(judge 间共识高于与人类共识 κ=0.84)
  • OpenClaw 已被纳入 worked example 库:Claude Code / Codex / OpenClaw / Hermes Agent 等均被列为标准 worked examples——OpenClaw 在评测生态中具有事实标准地位
  • eval 意义:提供了 Agent 失败归因的标准化 schema,与传统"pass@k 榜单"评测形成方法学互补;是评测基础设施的一部分
  • 与活文档现有脉络的关系: R75 §4 维度化指标体系(失败模式分类维度);R75 §6.133 候选区;与 LHTB(R75 锚入,false-finish 失败模式)方向一致但更系统化;与 VDiff-Bench(R75 锚入)同属终端 Agent 评测失败分析方向
  • 建议归入节: §4 维度化指标体系(Agent 失败归因 schema)+ §6.133 候选区(Model or Harness Failure Taxonomy)+ §3.1 #249 共识预备(false-finish 失败模式作为 agent 评测新发现)
  • 可信度: ★★★★(paper_card 726 ✓;flyp critical-read ★★★★;Scale AI 出品,方法学贡献具体;κ=0.76 跨模型验证)
  • ⚠️ 待核实: schema 是否公开;与其他 agent 失败归因方法学(Cemri 2025 / Zhu 2025 / Barke 2026)的对比;OpenClaw 具体如何映射到 41 类

增量 ④ DataFlex-RL HF 票数变化:96▲ Sep 15(#3)→ 110▲ Sep 16(#6),排名下滑但票数增长

  • 来源: HF Daily Sep 15(96▲ #3)+ HF Daily Sep 16(110▲ #6)+ paper_card 1343 ✓
  • 要点:
  • DataFlex-RL Sep 15 首进 Top15 即 #3(96▲),Sep 16 票数增至 110▲(+14▲)但排名降至 #6,说明新进条目(Vidu S2 532▲ / Atria Dawn 369▲ / ZGCM-1 291▲ 等)挤压了 eval 邻接条目的排名空间
  • 票数本身仍在增长(+14▲),但增速不及 Top15 整体票数膨胀速度
  • 与 R75 分析一致:DataFlex-RL 是 RLVR 数据策略评测平台,填补了现有 RL 评测空白
  • 与活文档现有脉络的关系: R75 已锚入(paper_card 1343 ✓);与 §4 维度化指标体系(RLVR 数据策略评测维度)+ §6.121 On-Policy Distillation II(RLVR 是 on-policy distillation 核心技术路径)
  • 建议归入节: §4 R76 续立校准区(DataFlex-RL 票数横盘,+14▲ 但排名从 #3 降至 #6)
  • 可信度: ★★★★(HF Daily 直接数据)

增量 ⑤ Benchmark Radar Sep 16 未出现 Top15——Sep 15 同日两次后立即退出

  • 来源: HF Daily Sep 15(80▲ + 75▲ 同日两次出现)+ HF Daily Sep 16(未出现 Top15)
  • 要点:
  • Benchmark Radar Sep 15 同日两次出现(#4 80▲ + #5 75▲)后,Sep 16 直接退出 Top15
  • 退出速度极快(仅维持 1 日),与 IdeaAMBIG/MetroLLM-Bench 的退出模式相似——eval 邻接条目的 HF 票数天花板偏低且不稳定
  • Benchmark Radar 作为"元评测基础设施"的价值不受 HF 票数影响,但需关注其是否会在后续日期重新进入 Top15
  • 与活文档现有脉络的关系: R75 §3.3 评测平台与 CI Gate(新增 Benchmark Radar 元评测基础设施)+ §9.1 评测平台总览(33 平台)——Benchmark Radar 本轮退出 Top15,但作为评测平台工具的定性不受票数影响
  • 建议归入节: §7.3 开放问题(修订 Benchmark Radar HF 票数消散截止日期)+ §3.3 评测平台(保留 Benchmark Radar 元评测基础设施定位,不因票数退出降级)
  • 可信度: ★★★★(HF Daily 直接数据,事实性可靠)

增量 ⑥ R75 锚入 eval 邻接条目 Sep 15 集体退出后 Sep 16 无回榜信号

  • 来源: HF Daily Sep 15(EvoSafeHarness 59▲ + WearableQA 38▲ + SWE-Bench Pro Verified 37▲ + MetroLLM-Bench 32▲ + IdeaAMBIG 23▲ 均退出)+ HF Daily Sep 16(eval 邻接条目无回榜信号)
  • 要点:
  • Sep 15 集体退出的 5 件 eval 邻接条目(EvoSafeHarness / WearableQA / SWE-Bench Pro Verified / MetroLLM-Bench / IdeaAMBIG)在 Sep 16 均无回榜信号
  • Sep 16 Top15 中无 eval 专项或 eval 邻接条目(DataFlex-RL 110▲ #6 是 Sep 15 已入榜的条目)
  • eval 邻接条目 HF 信号进入结构性低谷:Sep 13-16 连续 4 日无 eval 邻接新入 Top15,与 R75"评测领域进入信号密度低谷期"判断完全一致
  • 与活文档现有脉络的关系: R75 §7.3 开放问题(EvoSafeHarness / WearableQA / SWE-Bench Pro Verified / MetroLLM-Bench / IdeaAMBIG 核实截止日期均已过期);R75 §4 R75 续立校准核实区(5 件 eval 邻接退出 HF Top15)
  • 建议归入节: §7.3 开放问题(5 件 R75 锚入 eval 邻接条目核实截止日期更新:建议统一延长至 9-30)+ §4 R76 续立校准区(eval 邻接条目 HF 信号结构性低谷确认)
  • 可信度: ★★★★(HF Daily 直接数据)

2. Sep 15→16 eval 相关条目 HF Top15 变化全览

arXiv 标题 Sep 15 票数 Sep 16 票数 变化 R75 锚定状态 备注
2609.06107 DataFlex-RL 96▲ #3 110▲ #6 +14▲,排名-3 R75 eval 邻接已锚 票数增长但被新进条目挤出前 5
2609.11115 Benchmark Radar 80▲ #4 + 75▲ #5 退出 -155▲ R75 eval 邻接已锚 同日两次后仅维持 1 日即退出
2609.05903 EvoSafeHarness 退出 退出 无回榜 R75 eval 邻接已锚 Sep 15 退出后 Sep 16 无回榜
2609.05405 WearableQA 退出 退出 无回榜 R75 eval 邻接已锚 Sep 15 退出后 Sep 16 无回榜
2609.08149 SWE-Bench Pro Verified 退出 退出 无回榜 R75 eval 邻接已锚 Sep 15 退出后 Sep 16 无回榜
2609.10016 MetroLLM-Bench 退出 退出 无回榜 R75 eval 邻接已锚 Sep 15 退出后 Sep 16 无回榜
2609.10539 IdeaAMBIG 退出 退出 无回榜 R75 eval 专项已锚 Sep 15 退出后 Sep 16 无回榜
2609.06245 VDiff-Bench 退出 退出 无回榜 R75 eval 专项已锚 连续 5 日无 HF

: Sep 15→16 eval 相关条目信号进入结构性低谷——Benchmark Radar 同日两次出现(80▲+75▲)后仅维持 1 日即退出;5 件 eval 邻接条目 Sep 15 集体退出后 Sep 16 无一回榜;DataFlex-RL 票数增长但排名下滑。Sep 16 Top15 中 eval 专项/邻接仅剩 DataFlex-RL(110▲ #6)1 件。


3. Sep 14-16 paper_cards eval 相关新卡核查

Sep 14-16 新增 eval 主分类卡(2 件,均未入库 work-queue 高价值)

编号 arXiv 标题 形态 与 evaluation.md 关系
1377-2609.14302 2609.14302 E2A-Bench: Evidence-to-Action Reliability in Financial Chart Reasoning benchmark R76 eval 主分类新锚候选 · 金融图表证据-行动可靠性评测 · 969 query · HS300 成分股 · work-queue Top15 高价值(#3)
1378-2609.13948 2609.13948 Thought without systematicity? Evaluating reasoning models on rule induction tasks position R76 eval 主分类新锚候选 · 规则归纳任务评估推理模型系统性 · 认知科学方法学引入 · work-queue Top15 高价值(#2)

: Sep 14-16 paper_cards eval 主分类净增 2 件,但均未入库(paper_card 仅建立到 1377/1378 编号,说明是 Sep 16 14:10 入库的最新批次)。work-queue Sep 16 14:00 已将两者列入 Top15 高价值待深度解读,说明尚未完成内部审核流程。与 R75"Benchmark Radar 和 DataFlex-RL 作为 eval 相关 benchmark 值得关注,但主分类需进一步核实"的情况类似——本轮 E2A-Bench 和 Thought without systematicity? 均已确认 eval 主分类,但内部审核流程尚未完成。

Sep 14-16 新增 eval 邻接卡

编号 arXiv 标题 主分类 eval 关系
726-2607.28802 2607.28802 Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures engineering eval 邻接(Agent 失败归因标准化 schema · Scale AI 出品 · flyp critical-read ★★★★ · OpenClaw 纳入 worked example 库)
1379-2609.13463 2609.13463 Root-Cause Attribution Is a Search Problem agent eval 邻接(Agent 失败 RCA · 持续搜索框架 · Tom 9-16 0840 radar 高价值 #3)

: Model or Harness Failure Taxonomy(2607.28802,paper_card 726)主分类 engineering 副分类 agent,但 eval 关系明确——提供了 Agent 失败归因的标准化诊断 schema,是评测基础设施的核心组成部分。Root-Cause Attribution(2609.13463,paper_card 1379)主分类 agent,与 evaluation 邻接——RCA 是 Agent 可靠性的核心评估维度之一。


4. 矛盾与待核实

矛盾 ① Benchmark Radar 极短周期退出——元评测工具的 HF 信号稳定性问题

  • Sep 15 同日两次出现(80▲ + 75▲)→ Sep 16 直接退出 Top15,维持时间仅 1 日
  • 可能解释:Benchmark Radar 作为"meta tool"性质决定其受众较窄——研究评测方法学的社区成员少于直接使用 benchmark 评测模型的社区成员;HF 票数不代表工具质量
  • 风险:若 Benchmark Radar 持续退出 Top15,是否影响其作为"评测平台"定位的可信度?元评测工具的社区传播周期是否与 task benchmark 不同?
  • 建议: R76 活文档标注"Benchmark Radar 元评测工具定位不受 HF 票数影响,但需关注其是否有持续的用户活跃度指标(如 GitHub stars、学术引用)作为辅助信号

矛盾 ② E2A-Bench / Thought without systematicity? 未入库 vs work-queue 高价值标注

  • 两件 eval 主分类 paper_card 在 Sep 16 14:10 入库(1377/1378),但 work-queue Sep 16 14:00 已将两者标为 Top15 高价值待深度解读
  • 解读:work-queue 的 Top15 来自每日 arXiv 扫描,并非等待 paper_card 入库后才识别;说明这两个条目在 arXiv 扫描阶段已引起关注,但内部审核流程(paper_card 建卡 + 评估归类)尚未完成
  • 建议: R76 活文档将两者列为"待正式锚入候选",备注"paper_card 1377/1378 已入库(Sep 16 14:10),建议 R77 前完成评估"

矛盾 ③ eval 邻接条目 HF 信号结构性低谷 vs DataFlex-RL 票数持续增长

  • 5 件 eval 邻接条目 Sep 15 集体退出后 Sep 16 无回榜
  • DataFlex-RL 票数 Sep 15(96▲)→ Sep 16(110▲),+14▲,但排名从 #3 降至 #6
  • 解读:DataFlex-RL 的票数增长说明 RLVR 数据策略评测方向仍有关注度,但 eval 邻接条目整体票数天花板低(均未超过 60▲)且波动大;DataFlex-RL 首进即 96▲ 可能是因为 RLVR 方向的票数竞争烈度低于安全 benchmark(WearableQA)或代码评测(SWE-Bench)
  • 建议: R76 活文档建立"eval 邻接条目 HF 票数天花板分级":低天花板(<40▲,WearableQA/IdeaAMBIG/MetroLLM-Bench)+ 中天花板(40-80▲,SWE-Bench Pro Verified/EvoSafeHarness)+ 相对高天花板(>80▲,DataFlex-RL 暂属此类)

待核实 ①:Compile by Training 连续 9 日无 HF 记录

  • Sep 8 HF Daily #1 374▲ → Sep 9 无 → Sep 10 无 → Sep 11 无 → Sep 12 无 → Sep 13 无 → Sep 14 无 → Sep 15 无 → Sep 16 无
  • 持续时间: 连续 9 日无 HF Daily 记录
  • 建议: R76 活文档正式将 Compile by Training(2609.04199)从"已沉寂"归档为"历史锚入条目",注明"连续 9 日无 HF 记录"

待核实 ②:E2A-Bench 与 CiteGuard-RAG 的关系(同团队?互补?)

  • E2A-Bench(2609.14302)和 CiteGuard-RAG(2609.15830)均在 Sep 14-16 出现,分别来自 Tom radar 和 RAG pre-digest;两者都涉及"证据-引用-置信度"维度
  • 待核实: 是否同一团队工作;若是则两者方法论可能共享基础

5. 可引用 arXiv 号列表

本轮 eval 主分类新锚候选(2 件,均未完成内部审核): - 2609.14302 — E2A-Bench(paper_card 1377 ✓ · eval 主分类 · 金融图表证据-行动可靠性评测 · 969 query · HS300 · work-queue Top15 高价值 #3) - 2609.13948 — Thought without systematicity?(paper_card 1378 ✓ · eval 主分类 · position paper · 规则归纳任务评估推理模型系统性 · work-queue Top15 高价值 #2)

本轮 eval 邻接新锚候选(1 件): - 2607.28802 — Model or Harness Failure Taxonomy(paper_card 726 ✓ · engineering 主分类 eval 邻接 · Agent 失败归因 41 类 × interaction edge · Scale AI 出品 · flyp critical-read ★★★★ · OpenClaw 纳入 worked example 库)

本轮 eval 邻接条目 HF Top15 变化(1 件票数增长但排名下滑 + 1 件退出): - 2609.06107 — DataFlex-RL(paper_card 1343 ✓ · eval 邻接 · HF 96▲ Sep 15 #3 → 110▲ Sep 16 #6,+14▲,排名-3) - 2609.11115 — Benchmark Radar(paper_card 1338 ✓ · eval 邻接 · HF 80▲+75▲ Sep 15 同日两次 → Sep 16 退出 Top15)

R75 沿用 eval 专项/邻接(9 件待核实状态): - 2609.06245 — VDiff-Bench(paper_card 1290 ✓ · eval 专项 · ⚠ 连续 5 日无 HF) - 2609.10539 — IdeaAMBIG(paper_card 1331 ✓ · eval 专项 · ⚠ Sep 15 退出后 Sep 16 无回榜) - 2609.10016 — MetroLLM-Bench(paper_card 1326 ✓ · eval 邻接 · ⚠ Sep 15 退出后 Sep 16 无回榜) - 2609.05903 — EvoSafeHarness(paper_card 1321 ✓ · eval 邻接 · ⚠ Sep 15 退出后 Sep 16 无回榜) - 2609.05405 — WearableQA(paper_card 1303 ✓ · eval 邻接 · ⚠ Sep 15 退出后 Sep 16 无回榜) - 2609.08149 — SWE-Bench Pro Verified(paper_card 1308 ✓ · eval 邻接 · ⚠ Sep 15 退出后 Sep 16 无回榜) - 2609.04280 — EVOHarnessBENCH(paper_card 1293 ✓ · eval 专项) - 2609.08832 — Closing the Consistency Gap(paper_card 1288 ✓ · eval 专项) - 2609.09875 — AgentAudit(paper_card 1296 ✓ · eval 邻接)

R75 沿用 eval 邻接(2 件无变化): - 2609.09219 — DCP(paper_card 1300 ✓ · Sep 14-16 无 HF 票数记录) - 2609.09113 — SAEScientist-Bench(paper_card 1298 ✓ · Sep 14-16 无 HF 票数记录)

R75 沿用 eval 邻接 anchor(1 件): - 2607.08964 — Long-Horizon-Terminal-Bench / LHTB(paper_card 359 ✓ · agent/evaluation · flyp critical-read ★★ · R75 锚入评估流程中)

⚠ 正式归档(1 件): - 2609.04199 — Compile by Training(⚠ 连续 9 日无 HF 记录,建议正式归档为历史锚入条目)

eval 邻接待核实(1 件): - 2609.13463 — Root-Cause Attribution(paper_card 1379 ✓ · agent 主分类 eval 邻接 · Agent 失败 RCA 持续搜索框架)


6. 增量条数汇总

类别 条数 编号
eval 主分类新锚候选 2 ① E2A-Bench(2609.14302,paper_card 1377 ✓,work-queue Top15 高价值 #3)+ ② Thought without systematicity?(2609.13948,paper_card 1378 ✓,work-queue Top15 高价值 #2)
eval 邻接新锚候选 1 ③ Model or Harness Failure Taxonomy(2607.28802,paper_card 726 ✓,flyp critical-read ★★★★,OpenClaw 纳入 worked example 库)
eval 邻接 HF 票数变化 1 ④ DataFlex-RL(2609.06107,票数 96▲→110▲ +14▲,排名 #3→#6)
eval 邻接 HF 退出确认 1 ⑤ Benchmark Radar(2609.11115,Sep 15 同日两次后 Sep 16 退出 Top15)
eval 邻接条目无回榜确认 5 ⑥ EvoSafeHarness(2609.05903)+ ⑦ WearableQA(2609.05405)+ ⑧ SWE-Bench Pro Verified(2609.08149)+ ⑨ MetroLLM-Bench(2609.10016)+ ⑩ IdeaAMBIG(2609.10539)Sep 15 退出后 Sep 16 无回榜
连续消散确认 1 ⑪ VDiff-Bench(2609.06245,连续 5 日无 HF)
正式归档 1 ⑫ Compile by Training(2609.04199,连续 9 日无 HF)
合计净增量 3 ① E2A-Bench + ② Thought without systematicity? + ③ Model or Harness Failure Taxonomy

arXiv 号数量: 2 件本轮 eval 主分类新锚候选(E2A-Bench 2609.14302 + Thought without systematicity? 2609.13948)+ 1 件 eval 邻接新锚候选(Model or Harness 2607.28802)+ 2 件 eval 邻接 HF 变化(DataFlex-RL 2609.06107 + Benchmark Radar 2609.11115)+ 5 件 eval 邻接无回榜(EvoSafeHarness 2609.05903 + WearableQA 2609.05405 + SWE-Bench Pro Verified 2609.08149 + MetroLLM-Bench 2609.10016 + IdeaAMBIG 2609.10539)+ 1 件连续消散(VDiff-Bench 2609.06245)+ 1 件正式归档(Compile by Training 2609.04199)+ 3 件 R75 沿用无变化(EVOHarnessBENCH 2609.04280 + Closing Consistency Gap 2609.08832 + AgentAudit 2609.09875)+ 2 件 R75 沿用无 HF(DCP 2609.09219 + SAEScientist-Bench 2609.09113)+ 1 件 R75 锚入流程中(LHTB 2607.08964)+ 1 件 eval 邻接待核实(Root-Cause Attribution 2609.13463)= 20 件(3 件净增 + 7 件信号变化/消散/归档 + 10 件沿用/待核实)


7. 检查过的来源清单

已确认处理过的来源(如实说明): - ✅ Tom 9-15 evaluation e1prep(R76 基线,14 件 eval 专项/邻接 + Benchmark Radar/DataFlex-RL 新锚 + Compile by Training 降级) - ✅ Tom 9-16 0840 radar(8 候选,E2A-Bench #6 + Thought without systematicity? #2 + Root-Cause Attribution #3 高价值) - ✅ HF Daily Sep 16(15 篇 Top15:DataFlex-RL 110▲ #6 + 无 eval 专项/邻接新进;Benchmark Radar 退出确认) - ✅ spark 9-16 agent e1prep(Model or Harness Failure Taxonomy 2607.28802 flyp critical-read ★★★★ 增量 1) - ✅ Jay 9-16 csdn/arxiv(MC-Search / TechRAG / Agentic Reasoning Survey;无 eval 专项净增) - ✅ Stephen 9-16 ai-industry e1prep(frontier lab 治理公开化 + C 端产品 + Apple 集成;无 eval 专项净增) - ✅ paper_cards Sep 14-16 新卡核查(1377 E2A-Bench ✓ + 1378 Thought without systematicity? ✓ + 1379 Root-Cause Attribution ✓;3 件 eval 主分类/邻接新卡均入库) - ✅ work-queue 9-16 14:00(E2A-Bench Top15 高价值 #3 + Thought without systematicity? Top15 高价值 #2;无 eval 专项待建卡警告) - ✅ evaluation.md R75 基线(14 件 eval 专项/邻接 + Benchmark Radar/DataFlex-RL 新锚 + OPS I 10 日锁)


8. 无显著新增量时的如实说明

本轮 eval 专项净增 0 件完成审核的 paper_card,eval 邻接净增 3 件候选(E2A-Bench + Thought without systematicity? + Model or Harness Failure Taxonomy)。

信号质量评估: - E2A-Bench(work-queue Top15 高价值 #3)和 Thought without systematicity?(work-queue Top15 高价值 #2)均未完成内部审核流程(paper_card 刚入库),建议 R77 前完成评估后正式锚入 - Model or Harness Failure Taxonomy(flyp critical-read ★★★★)方法学贡献具体,提供 Agent 失败归因标准化 schema,与 LHTB 的 false-finish 失败模式形成互补,是 eval 领域的实质性方法学新增 - 无显著新增量的核心原因:Sep 14-16 是 eval 领域的结构性低谷期——HF Top15 无 eval 专项新进,paper_cards 无 eval 主分类完成审核的新卡,仅有的 3 件候选均未完成内部审核流程

本轮最大警示:Sep 15→16 eval 邻接条目 HF 信号进入结构性低谷——5 件 R75 锚入 eval 邻接条目 Sep 15 集体退出后 Sep 16 无一回榜;Sep 16 Top15 中 eval 专项/邻接仅剩 DataFlex-RL(110▲ #6)1 件。Benchmark Radar Sep 15 同日两次出现后仅维持 1 日即退出。eval 领域 HF 信号极不稳定,与 R75"评测领域进入信号密度低谷期"判断一致,且低谷程度比 R75 更深(R75 至少还有 DataFlex-RL + Benchmark Radar 两只票数在榜,本轮 0 件 eval 邻接新入 Top15)。

R76 活文档建议关注:① E2A-Bench 和 Thought without systematicity? 完成内部审核后正式锚入的优先级;② Model or Harness Failure Taxonomy 与 LHTB false-finish 失败模式的整合;③ VDiff-Bench 连续 5 日无 HF 是否触发降级为"已沉寂";④ 5 件 R75 锚入 eval 邻接条目的核实截止日期统一更新至 9-30。


Tom · 2026-09-16 15:40 CST · E1 预消化 · evaluation · R76 窗口覆盖完成 · 2 件 eval 主分类新锚候选(E2A-Bench 2609.14302 work-queue Top15 #3 + Thought without systematicity? 2609.13948 work-queue Top15 #2)+ 1 件 eval 邻接新锚候选(Model or Harness Failure Taxonomy 2607.28802 flyp critical-read ★★★★)+ 1 件 eval 邻接 HF 票数变化(DataFlex-RL 2609.06107 96▲→110▲ +14▲,排名 #3→#6)+ 1 件 eval 邻接 HF 退出(Benchmark Radar 2609.11115 Sep 15 同日两次后退出)+ 5 件 eval 邻接无回榜确认(EvoSafeHarness 2609.05903 + WearableQA 2609.05405 + SWE-Bench Pro Verified 2609.08149 + MetroLLM-Bench 2609.10016 + IdeaAMBIG 2609.10539)+ 1 件连续消散(VDiff-Bench 2609.06245 连续 5 日无 HF)+ 1 件正式归档(Compile by Training 2609.04199 连续 9 日无 HF)+ eval 领域 HF 信号结构性低谷确认(R75→R76 信号进一步下滑,Sep 16 Top15 仅剩 DataFlex-RL 1 件 eval 邻接)+ 0 件完成审核的 eval 专项 net-new paper_card