evaluation · E1 预消化简报(2026-09-14)

角色: Tom · E1 日间预消化轮(evaluation)· 窗口覆盖 2026-09-13 15:40 ~ 2026-09-14 15:40 CST 数据来源: Tom 9-13 evaluation e1prep 基线 + Tom 9-14 0841 radar + HF Daily 9-14 + flyp 9-14 LHTB critical-read ★★ + spark 9-14 agent e1prep + Jay 9-14 engineering e1prep + Stephen 9-14 ai-industry e1prep + paper_cards Sep 12-14 新卡核查 + work-queue 9-14 14:00 活文档基线: evaluation.md R73 锚定(VDiff-Bench 2609.06245 + IdeaAMBIG 2609.10539 + MetroLLM-Bench 2609.10016 + EvoSafeHarness 2609.05903 + SWE-Bench Pro Verified 2609.08149 + Diffs vs. Whole Files 2609.05779 + WearableQA 2609.05405 + DCP 2609.09219 + SAEScientist-Bench 2609.09113 + AgentAudit 2609.09875 + EVOHarnessBENCH 2609.04280 + Closing Consistency Gap 2609.08832)


0. 基线对齐与本轮概述

R73→R74 锚定状态: - 12 件 eval 专项/邻接(R73 已锚): VDiff-Bench(2609.06245)+ IdeaAMBIG(2609.10539)+ MetroLLM-Bench(2609.10016)+ EvoSafeHarness(2609.05903)+ SWE-Bench Pro Verified(2609.08149)+ Diffs vs. Whole Files(2609.05779)+ WearableQA(2609.05405)+ DCP(2609.09219)+ SAEScientist-Bench(2609.09113)+ AgentAudit(2609.09875)+ EVOHarnessBENCH(2609.04280)+ Closing Consistency Gap(2609.08832) - Compile by Training(2609.04199)R73 正式降级 ★★ → ★(连续 7+ 日无 HF 记录)

本轮 E1-R75 增量摘要: - 1 件 eval 邻接 net-new paper_card(Sep 12-14 新入库): Long-Horizon-Terminal-Bench(2607.08964,paper_card 359 ✓,flyp critical-read ★★) - 1 件 eval 专项 net-new paper_card 首次出现 HF 票数: MetroLLM-Bench(2609.10016,HF 32▲ Sep 14 首次入 Top15) - 1 件 eval 邻接票数大幅跳升: EvoSafeHarness(2609.05903,HF 47▲ → 59▲,+12▲) - 整体增量偏低但有质量信号——Sep 13-14 eval 专项有 1 件 eval 邻接新锚入(LHTB),MetroLLM-Bench 首次出现在 HF Top15,EvoSafeHarness 票数大幅跳升,signal 较 R74 的零增量低谷有所恢复


1. 增量条目(1 件 eval 邻接 net-new + 1 件 eval 专项 HF 首现 + 3 件矛盾/待核实)

增量 ① Long-Horizon-Terminal-Bench(arXiv:2607.08964):长时域终端 Agent 评测方法学新范式

  • 来源: flyp inbox/flyp/2026-09-14-0950-Long-Horizon-Terminal-Bench-agent-eval-critical-read.md(critical-read ★★,paper_card 359 ✓)+ spark 9-14 agent e1prep 增量 1 + stephen 9-14 ai-industry e1prep 邻接确认
  • 要点:
  • 46 个长时域任务,覆盖 9 类:实验复现/软件工程/多模态分析/交互游戏/科学计算;每任务平均 231 步 episode、9.9M token、85.3 分钟、$10.5 API 成本
  • 稠密奖励 + 部分得分(graded subtasks):将每任务拆解为细粒度 graded subtasks,给出连续部分分数;评测"agent 走了多远"而非只看"是否到终点"
  • 假终点 / false-finish 失败模式:frontier agent 普遍存在"提前宣告完成、跳过最终验证"的失败模式——这是 Terminal-Bench 2.0 报告的 verification failure 在长时域下的放大版
  • 15 个 frontier 模型评测结果:GPT-5.5 pass@1 (R≥0.95) = 15.2%,完美得分 (R=1.0) = 10.9%;15 模型平均 R≥0.95 仅 4.3%,R=1.0 仅 1.7%;整体远未饱和
  • 方法学贡献:subtask 拆解 + 部分得分的评分框架对 agent 评测方法学有参考价值,而非任务集本身(任务规模小、评测成本极高)
  • 与活文档现有脉络的关系: 与 R73 §4 维度化指标体系(长时域评测维度)直接相关。稠密奖励思路与 SWE-Bench Pro Verified(终端评测)邻接;false-finish 失败模式与 VDiff-Bench(R73 锚入)同属终端 Agent 评测的失败模式分析方向。paper_card 359 早已在库(早于本次 inbox 发现),但本次 flyp critical-read ★★ 触发正式锚入评估流程。
  • 建议归入节: §4 维度化指标体系(长时域 + 稠密奖励评测维度)+ §6.133 候选区(LHTB 长时域终端 Agent 评测)+ §3.1 #249 共识预备(false-finish 失败模式作为 agent 评测新发现)
  • 可信度: ★★★(paper_card 359 ✓;flyp critical-read ★★;Tencent HY LLM Frontier 主导;arXiv v2 非正式同行评审,缺独立第三方复现)
  • ⚠️ 待办: 观察 LHTB 是否在 HF Daily 出现票数;评估 46 任务统计功效是否足够;追踪 false-finish 量化分解是否在后续工作中给出

增量 ② MetroLLM-Bench(arXiv:2609.10016):HF Sep 14 首次 Top15 现身,票数 32▲

  • 来源: HF Daily Sep 14(paper_card 1326 ✓,Sep 12 已入库)+ Tom 9-14 0841 radar + R73 已锚
  • 要点: MetroLLM-Bench 在 Sep 14 HF Daily Top15 中以 32▲ 入围,为 Sep 12 锚入以来的首次 HF Top15 出现。票数处于中等偏低区间(32▲ vs LHTB 类 eval benchmark 尚未出现 HF 票数),但首次进入 Top15 标志着其社区传播进入活跃期。
  • 与活文档现有脉络的关系: R73 已锚入(paper_card 1326 ✓,eval 主分类 benchmark)。本次 HF Sep 14 首现 32▲ 提供了量化社区信号——R73 锚入时无票数,本次确认有效社区传播。建议标注"HF 32▲ Sep 14 首次 Top15"。
  • 建议归入节: §4 维度化指标体系(垂直领域结构化工具调用评测维度)+ §6.133 候选区(MetroLLM-Bench 交通售票机场景,HF 32▲ Sep 14 首次 Top15)
  • 可信度: ★★★(paper_card 1326 ✓;HF 32▲ Sep 14 首次 Top15)
  • ⚠️ 待办: 追踪 Sep 15-16 票数是否持续增长;评估 955 个实例的评测结果分布

增量 ③ EvoSafeHarness(arXiv:2609.05903):票数大幅跳升 47▲ → 59▲(+12▲)

  • 来源: HF Daily Sep 13(47▲)+ HF Daily Sep 14(59▲)+ paper_card 1321 ✓ + R73 已锚(eval 主分类 agent 副分类)
  • 要点: EvoSafeHarness 在 Sep 13(47▲)→ Sep 14(59▲)出现 +12▲ 大幅跳升,为 Sep 12 锚入以来的最大单日涨幅。59▲ 在 eval 邻接条目中属中高票数,演进式安全 harness 方向获得社区持续关注。
  • 与活文档现有脉络的关系: R73 已锚入(paper_card 1321 ✓,eval 主分类 agent 副分类)。本轮 +12▲ 跳升是 eval 邻接条目中票数信号最强的条目,建议标注"HF 59▲ Sep 14,+12▲ 单日跳升,演进式安全 harness 方向获社区持续关注"。
  • 建议归入节: §3.5 harness 生态(EvoSafeHarness 演进式安全 harness)+ §4 维度化指标体系(Agent 安全评测 OWASP + 演进式 harness)
  • 可信度: ★★★★(paper_card 1321 ✓;HF 59▲ 持续在榜;+12▲ 单日跳升信号强)
  • ⚠️ 待办: 评估该框架是否已在 MCP 生态论文中被引用;追踪演进式 harness 与 OWASP MCP Top 10 的整合进展

2. HF Daily Sep 13→14 eval 相关条目票数延续核实

Sep 13→14 eval 相关条目票数变化

arXiv 标题 Sep 13 票数 Sep 14 票数 变化 R73 锚定状态 备注
2609.05903 EvoSafeHarness 47▲ 59▲ +12▲ R73 ★★ 已锚 本轮最大票数跳升
2609.05405 WearableQA 37▲ 38▲ +1▲ R73 ★ 已锚 票数横盘
2609.08149 SWE-Bench Pro Verified 23▲ 37▲ +14▲ R73 ★★ 已锚 票数大幅跳升,从 23▲ 到 37▲
2609.10016 MetroLLM-Bench 未出现 32▲ 首现 R73 ★ 已锚 首次进入 HF Top15
2609.10539 IdeaAMBIG 未出现 23▲ 首现 R73 ★★★ 已锚(Tom radar ⭐⭐⭐) 首次出现 HF 票数

: Sep 14 HF Daily eval 相关条目出现整体复苏信号——EvoSafeHarness +12▲、SWE-Bench Pro Verified +14▲、MetroLLM-Bench 和 IdeaAMBIG 均为首次出现票数(而非继续无票)。eval 邻接条目整体信号密度较 Sep 12-13 的低谷明显回升。


3. Sep 12-14 paper_cards eval 相关新卡核查

Sep 12-14 新增 eval 主分类卡

编号 arXiv 标题 形态 与 evaluation.md 关系
1331-2609.10539 2609.10539 IdeaAMBIG benchmark R73 已锚;Sep 14 HF 23▲ 首次出现票数
1326-2609.10016 2609.10016 MetroLLM-Bench benchmark R73 已锚;Sep 14 HF 32▲ 首次进入 Top15

: Sep 12-14 eval 专项 paper_card 净增 0 张(两件均已在 R73 锚入),但 HF 票数信号出现显著变化:MetroLLM-Bench 首次 Top15(32▲),IdeaAMBIG 首次出现票数(23▲)。

Sep 12-14 新增 eval 邻接卡(主分类非 eval,eval 相关)

编号 arXiv 标题 主分类 与 eval 关系
1314-2609.11596 2609.11596 EBL-Core(高风险 AI 操作执行边界合规规范) agent eval 邻接(AI action 执行授权语义规范)
359-2607.08964 2607.08964 Long-Horizon-Terminal-Bench agent/evaluation eval 邻接(长时域终端 agent 评测方法学)

: EBL-Core(2609.11596,paper_card 1314)主分类 agent,但与 evaluation 邻接——定义了 AI 生成的候选操作是否可被授权执行的语义契约,本质上是"执行授权评测"的形式化规范层,建议归入 eval 邻接候选区。LHTB(2607.08964,paper_card 359)主分类 agent/evaluation,已在 R73 前入库,本次由 flyp critical-read ★★ 触发正式锚入流程。


4. 矛盾与待核实

矛盾 ① Compile by Training 信号衰减——第 7 次确认

  • Sep 8 HF Daily #1 374▲ → Sep 9 无 → Sep 10 无 → Sep 11 无 → Sep 12 无 → Sep 13 无 → Sep 14 无
  • 持续时间: 连续 7 日无 HF Daily 记录
  • 建议: R75 活文档正式将 Compile by Training(2609.04199)从 ★ 降级为"已沉寂",归入 §6.133 候选区底部,注明"连续 7 日无 HF 记录"

矛盾 ② VDiff-Bench 票数消散——第 3 次确认

  • R73 锚入时 30▲(Sep 11),Sep 12 无记录,Sep 13 无记录,Sep 14 无记录
  • 已连续 3 日无 HF 记录
  • 建议: VDiff-Bench paper_card 1290 仍在库,标注为"⚠ 票数消散,Eval 邻接 benchmark,可能已低于 HF Top15 采样下限"

矛盾 ③ IdeaAMBIG / MetroLLM-Bench HF 票数信号解读

  • 两件 R73 锚入的 eval 专项 benchmark,Sep 11-13 均无 HF 票数;Sep 14 IdeaAMBIG 首次出现 23▲、MetroLLM-Bench 首次进入 Top15(32▲)
  • 解读: 新生 benchmark 传播周期约 3-6 天后开始在 HF 出现票数,与 Compile by Training 的极速传播(1 日 374▲)形成鲜明对比——Eval benchmark 的票数信号密度远低于 training/inference 类 paper
  • 建议: 持续追踪 IdeaAMBIG 和 MetroLLM-Bench 的票数走向;Eval benchmark 社区投票文化可能不同于 training paper

矛盾 ④ EBL-Core(2609.11596)与 Policy Kernel 的关系待厘清

  • Jay 9-14 engineering e1prep 增量 5 指出:EBL-Core 是 Policy Kernel 的"形式化规范层",Policy Kernel 是"runtime 拦截机制"——二者构成"执行治理规范层 + 实现层"的配对关系
  • eval 视角: EBL-Core 定义了"AI action 执行授权"的语义契约,本质上是一种"执行前评测"框架,与传统 benchmark 在"执行后评分"不同
  • 建议: R75 活文档中评估 EBL-Core 是否应归入 eval 邻接候选区

5. 可引用 arXiv 号列表

本轮 eval 邻接 net-new(1 件): - 2607.08964 — Long-Horizon-Terminal-Bench / LHTB(paper_card 359 ✓ · flyp critical-read ★★ · 长时域终端 Agent 评测方法学 · 稠密奖励 + graded subtasks · false-finish 失败模式 · GPT-5.5 pass@1 15.2%)

本轮 eval 专项 HF 票数首现(2 件): - 2609.10016 — MetroLLM-Bench(paper_card 1326 ✓ · eval 主分类 · benchmark · HF 32▲ Sep 14 首次 Top15) - 2609.10539 — IdeaAMBIG(paper_card 1331 ✓ · eval 主分类 · benchmark · HF 23▲ Sep 14 首次出现票数)

R73 沿用 eval 专项(2 件): - 2609.06245 — VDiff-Bench(paper_card 1290 ✓ · eval 主分类 · benchmark · ⚠ 票数消散,连续 3 日无 HF) - 2609.10539 — IdeaAMBIG(同上,已 HF 首现 23▲)

R73 沿用 eval 邻接(4 件): - 2609.05903 — EvoSafeHarness(paper_card 1321 ✓ · eval 邻接 · 安全 harness · HF 59▲ Sep 14 +12▲ 跳升) - 2609.05405 — WearableQA(paper_card 1303 ✓ · eval 邻接 · 健康推理 benchmark · HF 38▲ Sep 14 横盘) - 2609.08149 — SWE-Bench Pro Verified(paper_card 1308 ✓ · eval 邻接 · 评测质量修复 · HF 37▲ Sep 14 +14▲ 跳升) - 2609.10016 — MetroLLM-Bench(同上,已 HF 首现 32▲)

R72 沿用 eval 专项(4 件): - 2609.04280 — EVOHarnessBENCH(paper_card 1293 ✓) - 2609.08832 — Closing the Consistency Gap(paper_card 1288 ✓) - 2609.09875 — AgentAudit(paper_card 1296 ✓) - 2609.09113 — SAEScientist-Bench(paper_card 1298 ✓)

R73 沿用 eval 邻接 benchmark(2 件): - 2609.09219 — DCP(paper_card 1300 ✓ · HF 16▲ · Sep 12-14 无新票数) - 2609.09113 — SAEScientist-Bench(同上,已 R73 锚入)

⚠ 信号衰减(1 件): - 2609.04199 — Compile by Training(⚠ 连续 7 日无 HF 记录,建议正式移除 Top15 候选池)

eval 邻接待评估(1 件): - 2609.11596 — EBL-Core(paper_card 1314 ✓ · agent 主分类 eval 邻接 · 执行边界合规规范 · Policy Kernel 形式化语义层)


6. 增量条数汇总

类别 条数 编号
eval 邻接 net-new paper_card 1 ① LHTB(2607.08964,flyp critical-read ★★)
eval 专项 HF 首现票数 2 ② MetroLLM-Bench(2609.10016,HF 32▲)+ ③ IdeaAMBIG(2609.10539,HF 23▲)
eval 邻接票数大幅跳升 1 ④ EvoSafeHarness(2609.05903,47▲→59▲,+12▲)+ SWE-Bench Pro Verified(2609.08149,23▲→37▲,+14▲)
信号衰减确认 1 ⚠ Compile by Training(连续 7 日无 HF 记录)
矛盾待核实 3 VDiff-Bench 票数消散(连续 3 日无 HF)+ EBL-Core 归类待厘清 + IdeaAMBIG/MetroLLM-Bench 票数解读
合计净增量 3 ① LHTB(eval 邻接)+ ② MetroLLM-Bench(eval 专项 HF 首现)+ ③ IdeaAMBIG(eval 专项 HF 首现)+ ④ EvoSafeHarness(eval 邻接票数跳升)+ ⑤ SWE-Bench Pro Verified(eval 邻接票数跳升)

arXiv 号数量: 1 件本轮新增 eval 邻接(LHTB 2607.08964)+ 2 件本轮 eval 专项 HF 首现(MetroLLM-Bench 2609.10016 + IdeaAMBIG 2609.10539)+ 2 件 eval 邻接票数跳升(EvoSafeHarness 2609.05903 + SWE-Bench Pro Verified 2609.08149)+ 1 件 ⚠ 信号衰减待移除(Compile by Training 2609.04199)+ 2 件 R73 沿用 eval 专项待核实(VDiff-Bench 2609.06245 + AgentAudit 2609.09875)+ 4 件 R72 沿用 eval 专项(EVOHarnessBENCH + Closing Consistency Gap + AgentAudit + SAEScientist-Bench)+ 2 件 eval 邻接 benchmark 横盘(DCP + SAEScientist-Bench)+ 1 件 eval 邻接待评估(EBL-Core 2609.11596)= 16 件(11 件可用 + 1 件待移除 + 4 件待核实)


7. 检查过的来源清单

已确认处理过的来源(如实说明): - ✅ Tom 9-13 evaluation e1prep(R75 基线,12 件 eval 专项/邻接 + Compile by Training 降级) - ✅ Tom 9-14 0841 radar(8 条候选,0 件 eval 专项 net-new;MaP-WAM/IdeaAMBIG/δ-mem 均为 agent/rag) - ✅ HF Daily Sep 14(15 篇 Top15:MetroLLM-Bench 32▲ 首次 Top15 + IdeaAMBIG 23▲ 首次出现票数 + EvoSafeHarness 59▲ +12▲ + SWE-Bench Pro Verified 37▲ +14▲) - ✅ flyp 9-14 LHTB critical-read ★★(Long-Horizon-Terminal-Bench,eval 邻接,paper_card 359 ✓) - ✅ spark 9-14 agent e1prep(LHTB ★★ 增量 1 + WMRL 447▲ 立标极显著 48h+ 续立稳态) - ✅ Jay 9-14 engineering e1prep(EBL-Core 2609.11596 eval 邻接 + Policy Kernel 概念;无 eval 专项净增) - ✅ Stephen 9-14 ai-industry e1prep(LHTB 邻接 ai-industry;无 eval 专项净增) - ✅ paper_cards Sep 12-14 新卡核查(1331 IdeaAMBIG ✓ + 1326 MetroLLM-Bench ✓ 均为 R73 已锚;1314 EBL-Core eval 邻接待评估;359 LHTB eval 邻接触发锚入) - ✅ work-queue 9-14 14:00(选题榜 1 件 2609.10226 Φ-Bench,inference 主轴邻接 eval;无 eval 专项待建卡警告) - ✅ evaluation.md R73 基线(12 件 eval 专项/邻接 + Compile by Training 降级 + OPS I 10 日锁)


8. 无显著新增量时的如实说明

本轮 eval 专项净增 0 件 paper_card,eval 邻接净增 1 件(LHTB,paper_card 359 早已在库,本次 flyp critical-read ★★ 触发锚入流程)。但信号密度较 R74 的零增量低谷有明显复苏: - MetroLLM-Bench 首次进入 HF Top15(32▲),IdeaAMBIG 首次出现 HF 票数(23▲) - EvoSafeHarness 票数大幅跳升(47▲ → 59▲,+12▲),SWE-Bench Pro Verified 同步跳升(23▲ → 37▲,+14▲) - eval 邻接 LHTB 由 flyp critical-read ★★ 触发锚入评估,提供长时域评测方法学新视角

eval 领域信号特征更新:与 training/inference 类 paper 不同,eval benchmark 的 HF 票数传播周期较长(IdeaAMBIG/MetroLLM-Bench 均在发布后 3-6 天才开始出现票数),票数密度也普遍偏低(32▲ vs WMRL 447▲)。这一特征对于评估 eval 专项信号具有参考意义——票数低于 30▲ 的 eval benchmark 未必代表无影响力,可能是传播周期尚未到达。

本轮最大警示: VDiff-Bench 票数消散(连续 3 日无 HF)、Compile by Training 连续 7 日无记录——已有锚入条目需关注票数横盘/消散趋势,以判断哪些条目应降级或归档。


Tom · 2026-09-14 15:40 CST · E1 预消化 · evaluation · R75 窗口覆盖完成 · 1 件 eval 邻接 net-new(LHTB 2607.08964 flyp critical-read ★★)+ 2 件 eval 专项 HF 首现票数(MetroLLM-Bench 2609.10016 HF 32▲ + IdeaAMBIG 2609.10539 HF 23▲)+ 2 件 eval 邻接票数大幅跳升(EvoSafeHarness 2609.05903 47▲→59▲ +12▲ + SWE-Bench Pro Verified 2609.08149 23▲→37▲ +14▲)+ ⚠ 1 件信号衰减确认(Compile by Training 2609.04199 连续 7 日无 HF)+ ⚠ 3 件矛盾待核实(VDiff-Bench 票数消散连续 3 日无 HF + EBL-Core 归类待厘清 + IdeaAMBIG/MetroLLM-Bench 票数解读)+ eval 领域信号特征更新(eval benchmark 传播周期较长 3-6 天,票数密度普遍偏低)+ 整体信号较 R74 低谷明显复苏(EvoSafeHarness/SWE-Bench Pro Verified 跳升 + MetroLLM-Bench/IdeaAMBIG 首次 HF 票数)