evaluation · E1 预消化简报(2026-09-12)

角色: Tom · E1 日间预消化轮(evaluation)· 窗口覆盖 2026-09-11 15:40 ~ 2026-09-12 15:40 CST 数据来源: Tom 9-11/9-12 evaluation e1prep 基线 + Tom 9-12 0840 radar + HF Daily 9-11/9-12 + Jay 9-12 engineering e1prep + spark 9-12 agent e1prep + Stephen 9-12 1245 coord-check noon + paper_cards Sep 10-12 新卡核查 + work-queue 9-12 12:00 活文档基线: evaluation.md R72 锚定(EVOHarnessBENCH 2609.04280 + Closing Consistency Gap 2609.08832 + AgentAudit 2609.09875 + SAEScientist-Bench 2609.09113 + VDiff-Bench 2609.06245 R73净增 + SWE-Bench Pro Verified 2609.08149 paper_card 1308 9-11入库确认 + OWASP MCP Top 10 beta + Cameron Wolfe Agent Evals)


0. 基线对齐与本轮概述

R72→R73 锚定状态: - 5 件 eval 专项 paper_card(R72 已锚): EVOHarnessBENCH(2609.04280)+ Closing Consistency Gap(2609.08832)+ VDiff-Bench(2609.06245,R73净增)+ AgentAudit(2609.09875)+ SAEScientist-Bench(2609.09113) - 2 件 eval 邻接(R72 已锚): SWE-Bench Pro Verified(2609.08149,paper_card 1308 ✓ 9-11入库)+ Closing Consistency Gap(benchmark形态) - OWASP MCP Top 10 beta + Cameron Wolfe Agent Evals(R72 框架信号,非arXiv)

本轮 E1-R74 增量摘要: - 2 件 eval 专项 net-new paper_card(Sep 12 新入库): IdeaAMBIG(2609.10539,主分类 evaluation)+ MetroLLM-Bench(2609.10016,主分类 evaluation) - 1 件 eval 邻接 net-new paper_card(Sep 12 新入库): EvoSafeHarness(2609.05903,主分类 evaluation 副分类 agent) - 信号衰减第 4 次确认: Compile by Training(2609.04199)——9-08 #1 374▲ → 9-09无 → 9-10无 → 9-11无 → 9-12无,连续5日无记录,建议正式降级 - 整体增量偏低——Sep 11-12 eval 专项 arXiv 新增 2 件(IdeaAMBIG + MetroLLM-Bench),信号密度较 R73(1件 VDiff-Bench)略有回升但仍属低量级


1. 增量条目(2 件 eval 专项 net-new + 1 件 eval 邻接 + 1 件信号降级确认)

增量 ① IdeaAMBIG(2609.10539):研究构想规范中面向实现的关键缺口基准

  • 来源: paper_card 1331(2026-09-12 12:30 入库,主分类 evaluation,形态 benchmark)+ Tom 9-12 0840 radar 高价值条目 ⭐⭐⭐ + spark 9-12 agent e1prep §增量 1 + Stephen 9-12 1245 coord-check noon 提及
  • 要点: 一个研究构想可能新颖、连贯且科学合理,但其方法规范可能不足以被忠实实现(codification readiness)。IdeaAMBIG 评估 AI Agent 或编码 Agent 能否在无额外假设下忠实复现论文方法。从论文/代码库/issue 讨论/复现工件构建了 660 个 evidence-grounded 实例基准。核心评测价值:当前 benchmark 多评估"任务能否完成",IdeaAMBIG 评估"方法描述是否足以指导忠实复现"——填补评测领域一个未被系统解决的空白。与 AgentAudit(十维信任评估)互补:后者评估 agent 执行过程的可信性,前者评估方法规范本身的"可编码性"。
  • 与活文档现有脉络的关系: 与 R72 §4 维度化指标体系(Agent 评测多维度)直接相关——codification readiness 是评测"方法忠实度"的新维度。与 VDiff-Bench(R73净增,同属 evaluation 主分类)同属 eval benchmark 基础设施化方向。eval.md R72 无此条目锚定。
  • 建议归入节: §4 维度化指标体系(codification readiness 评测维度)+ §6.133 候选区(IdeaAMBIG 研究构想忠实度基准)
  • 可信度: ★★★(paper_card 1331 已建,eval 主分类 benchmark;Tom radar ⭐⭐⭐ 高价值;HF Daily Sep 12 未出票但 Sep 12 radar ⭐⭐⭐;无独立 HF 票数,需观察后续传播)
  • ⚠️ 待办: 追踪 HF Daily 是否出现票数;评估 660 实例的规模是否足够统计意义;核查 paper 是否已在 method repo / code agent 相关论文中被引用

增量 ② MetroLLM-Bench(2609.10016):将语言模型作为交通售票机运行时进行评估

  • 来源: paper_card 1326(2026-09-12 12:30 入库,主分类 evaluation,形态 benchmark)+ Tom 9-12 0840 radar 中价值条目
  • 要点: MetroLLM-Bench 提供 955 个用例基准,测试 LLM 作为交通售票机策略层的能力。覆盖六个真实地铁系统(37-414 个站点),11 个类别(路径规划/票价计算/运行中断/无障碍/对抗性输入)。模型必须调用结构化工具并提交机器可渲染终态。Tier 1 为 4 个确定性评分组件;Tier 2 为 8 个语义质量组件。评测特征:垂直领域 domain-specific benchmark + 结构化工具调用 + 客观可验证终态——与通用 coding benchmark 相比更接近"任务完成质量可客观评测"的理想评测场景。
  • 与活文档现有脉络的关系: 与 R72 §4 维度化指标体系(垂直领域评测维度)邻接。与 Diffs vs. Whole Files(2609.05779,同属 evaluation 主分类 benchmark 形态)同属垂直领域实证评测方向。eval.md R72 无此条目锚定。
  • 建议归入节: §4 维度化指标体系(垂直领域结构化工具调用评测维度)+ §6.133 候选区(MetroLLM-Bench 交通售票机场景评测)
  • 可信度: ★★★(paper_card 1326 已建,eval 主分类 benchmark;真实地铁系统数据增强可信度;HF Daily Sep 12 无票数)
  • ⚠️ 待办: 评估该 benchmark 是否在 tool-connected agents / MCP 相关论文中被引用;追踪 955 个实例的评测结果分布

增量 ③ EvoSafeHarness(2609.05903):面向 Agent 安全防护的演进式模型与领域专属 Harness

  • 来源: paper_card 1321(2026-09-12 12:30 入库,主分类 evaluation,副分类 agent)+ HF Daily Sep 12 36▲(排名中等)+ R72 候选区延续
  • 要点: LLM Agent 将语言转化为现实世界影响,必须防御间接提示注入和直接有害请求。现有安全 harness 由专家一次性设计后通用,忽略"有效保护具有部署依赖性"——不同模型在效用下降前所能承受的强制程度不同,不同领域需要被管控的影响/状态/动作序列也各不相同。EvoSafeHarness 提出演进式安全 harness,根据模型和领域特性动态适配。与 OWASP MCP Top 10 beta(R72 锚定)形成互补:OWASP MCP Top 10 是静态安全风险清单,EvoSafeHarness 是动态演进式安全 harness 设计框架。
  • 与活文档现有脉络的关系: 与 R72 §3.5 harness 生态候选二十角(演进式 harness 方向)直接相关。与 OWASP MCP Top 10 beta(首个 MCP 安全评估清单)同属 agent 安全评测方向。eval.md R72 候选区有 EvoSafeHarness(当时 paper_card 未建),本轮 paper_card 1321 确认入库。
  • 建议归入节: §3.5 harness 生态候选二十角(EvoSafeHarness 演进式安全 harness)+ §4 维度化指标体系(Agent 安全评测 OWASP + 演进式 harness)
  • 可信度: ★★★(paper_card 1321 已建,eval 主分类 agent 副分类;HF 36▲ 中等票数;演进式 harness 方法论有新意)
  • ⚠️ 待办: 追踪 EvoSafeHarness 与 OWASP MCP Top 10 的整合可能性;评估该框架是否已在 MCP 生态论文中被引用

增量 ⚠ Compile by Training 信号衰减第 4 次确认——建议正式降级

  • 来源: HF Daily Sep 8 #1 374▲ → Sep 9 无 → Sep 10 无 → Sep 11 无 → Sep 12 无
  • 持续时间: 连续 5 日无 HF Daily 记录——9-08 极显著信号(374▲)后持续衰减至采样阈值以下
  • R72 原锚定: "极显著续立"(374▲ +57 续立),R71 标注"⚠ 信号断裂待核实"
  • 建议: 在 evaluation.md 中将 Compile by Training(2609.04199)从 ★★ 正式降级为 ★(信号衰减),归入 §6.133 候选区底部,注明"连续5日无 HF Daily 记录,信号已衰减"

2. Sep 10-12 paper_cards eval 相关新卡核查

Sep 12 新增 eval 主分类卡(2 件)

编号 arXiv 标题 形态 与 eval.md 关系
1331-2609.10539 2609.10539 IdeaAMBIG benchmark R74 净增(codification readiness 评测)
1326-2609.10016 2609.10016 MetroLLM-Bench benchmark R74 净增(垂直领域工具调用评测)

Sep 10-12 新增 eval 邻接卡(主分类非 eval,eval 相关)

编号 arXiv 标题 主分类 与 eval 关系
1321-2609.05903 2609.05903 EvoSafeHarness evaluation(副分类agent) R74 净增邻接(演进式安全 harness)
1308-2609.08149 2609.08149 SWE-Bench Pro Verified evaluation R73 补建确认(本轮 paper_card 1308 ✓ 9-11入库)
1303-2609.05405 2609.05405 WearableQA evaluation 9-10/9-11 HF 回流(28▲/31▲),eval邻接(可穿戴数据健康推理 benchmark)
1302-2609.05779 2609.05779 Diffs vs. Whole Files evaluation 9-12 paper_card 入库确认(Flutter/Dart diff vs 整文件生成实证比较)

: Sep 11-12 eval 专项 paper_card 净增 2 件(IdeaAMBIG + MetroLLM-Bench),信号密度较 R73(1件 VDiff-Bench)略有回升。EvoSafeHarness paper_card 1321 入库确认了 R72 候选区条目。Compile by Training(2609.04199)连续5日无 HF 记录,建议正式降级。


3. 矛盾与待核实

矛盾 ① Compile by Training 信号断裂——第 4 次确认,建议正式降级

  • Sep 8 HF Daily #1 374▲ → Sep 9 无 → Sep 10 无 → Sep 11 无 → Sep 12 无
  • 持续时间: 连续 5 日——已超出采样波动解释范围
  • 建议: R74 正式将 Compile by Training 从 ★★ 降级为 ★,归入候选区底部,注明信号衰减状态

矛盾 ② IdeaAMBIG / MetroLLM-Bench 无 HF Daily 票数

  • 两件 eval 专项 paper_card 已入库(1331/1326),但 HF Daily Sep 11-12 均无票数
  • 可能原因: Sep 12 HF Daily 早棒 15 篇,IdeaAMBIG(Sep 8 发布)和 MetroLLM-Bench(Sep 7 发布)可能票数低于 Top15 阈值
  • 建议: 观察 Sep 13-14 是否出现票数;如持续无票数,评估其作为"新生 benchmark 尚未广泛传播"而非"无影响力"

矛盾 ③ VDiff-Bench 票数消失(续 R73 矛盾②)

  • R73 锚入时 30▲(Sep 11),Sep 12 HF Daily 无 VDiff-Bench 记录
  • 可能原因: 票数低于 Top15 采样下限,或 9-12 新 paper 增多导致排名下降
  • 建议: VDiff-Bench paper_card 1290 仍在库(9-11 入库),标注为"⚠ 票数待核实"

4. 可引用 arXiv 号列表

本轮 eval 专项 net-new(2 件): - 2609.10539 — IdeaAMBIG(paper_card 1331 ✓ · eval 主分类 · benchmark · Tom radar ⭐⭐⭐) - 2609.10016 — MetroLLM-Bench(paper_card 1326 ✓ · eval 主分类 · benchmark)

本轮 eval 邻接 net-new(1 件): - 2609.05903 — EvoSafeHarness(paper_card 1321 ✓ · eval 主分类 agent 副分类 · 安全 harness · HF 36▲)

R73 沿用 eval 专项(1 件): - 2609.06245 — VDiff-Bench(paper_card 1290 ✓ · eval 主分类 · benchmark · ⚠ 票数待核实)

R72 沿用 eval 专项(3 件): - 2609.04280 — EVOHarnessBENCH(paper_card 1293 ✓) - 2609.08832 — Closing the Consistency Gap(paper_card 1288 ✓) - 2609.09875 — AgentAudit(paper_card 1296 ✓) - 2609.09113 — SAEScientist-Bench(paper_card 1298 ✓)

R73 沿用 eval 邻接(2 件): - 2609.08149 — SWE-Bench Pro Verified(paper_card 1308 ✓ 9-11入库 · HF 21▲) - 2609.05779 — Diffs vs. Whole Files(paper_card 1302 ✓ 9-12入库)

⚠ 信号衰减(1 件): - 2609.04199 — Compile by Training(⚠ 连续5日无 HF 记录,建议正式降级)

eval 邻接 benchmark(1 件): - 2609.05405 — WearableQA(paper_card 1303 ✓ · HF 28▲/31▲ 回流)


5. 增量条数汇总

类别 条数 编号
eval 专项 net-new paper_card 2 ① IdeaAMBIG(2609.10539)+ ② MetroLLM-Bench(2609.10016)
eval 邻接 net-new paper_card 1 ③ EvoSafeHarness(2609.05903,paper_card 1321 ✓ 9-12入库)
信号降级确认 1 ⚠ Compile by Training 信号衰减第4次确认(连续5日无 HF 记录)
合计净增量 3 ①-③(3 件 eval 相关)+ ⚠ 信号降级(1 件)

arXiv 号数量: 2 件本轮新增 eval专项(IdeaAMBIG + MetroLLM-Bench)+ 1 件本轮新增 eval邻接(EvoSafeHarness)+ 1 件 R73 沿用 eval专项待核实(VDiff-Bench ⚠)+ 4 件 R72 沿用 eval专项(EVOHarnessBENCH + Closing Consistency Gap + AgentAudit + SAEScientist-Bench)+ 2 件 R73 沿用 eval邻接(SWE-Bench Pro Verified + Diffs vs. Whole Files)+ 1 件 ⚠ 信号衰减待降级(Compile by Training)+ 1 件 eval邻接 benchmark回流(WearableQA)= 11 件(8 件可用 + 1 件邻接确认 + 2 件待处理)


6. 检查过的来源清单

已确认无 eval 专项新增量的来源(如实说明): - Stephen 9-11 inbox(X vip radar + OpenAI/Anthropic/DeepMind news;主轴 frontier lab + VLMs;eval 邻接有 CursorBench 73.4%(Anthropic 发布)+ Gemini 3.8 Flash SWE 自动漏洞修补;无 eval 专项净增) - Jay 9-11 inbox(engineering e1prep + engineering filter;主轴工程实践;eval 相关有 OWASP MCP Top 10 beta(已在 R73 锚入)+ InferenceBench(已在 engineering.md);eval 专项无独立净增) - flyp 9-11 inbox(multimodal e1prep + Show-Harness critical read;主轴 multimodal;eval 相关有 Cameron Wolfe Agent Evals RSS 信号(已在 R73 锚入);无 eval 专项净增) - spark 9-11 inbox(agent e1prep;主轴 agent;eval 相关有 VDiff-Bench + SWE-Bench Pro Verified + AgentAudit(均已在 R73 锚入);无独立 eval 专项净增) - spark 9-12 inbox(agent e1prep;主轴 agent;eval 相关有 IdeaAMBIG(⭐⭐⭐ 高价值已锚入本轮增量①)+ EvoSafeHarness(paper_card 1321 已锚入本轮增量③);无独立 eval 专项净增)

本轮实际处理的新增来源: - ✅ Tom 9-12 0840 radar(IdeaAMBIG ⭐⭐⭐ 高价值 + MetroLLM-Bench 中价值 + EvoSafeHarness 中价值) - ✅ HF Daily Sep 11(VDiff-Bench 30▲ + WearableQA 28▲ + SWE-Bench Pro Verified 19▲) - ✅ HF Daily Sep 12(EvoSafeHarness 36▲ + WearableQA 31▲ + SWE-Bench Pro Verified 21▲) - ✅ paper_cards Sep 10-12 新卡核查(1331 IdeaAMBIG ✓ + 1326 MetroLLM-Bench ✓ + 1321 EvoSafeHarness ✓ + 1308 SWE-Bench Pro Verified ✓ + 1303 WearableQA ✓ + 1302 Diffs vs. Whole Files ✓) - ✅ Jay 9-12 engineering e1prep(Diffs vs. Whole Files 邻接锚入) - ✅ Stephen 9-12 1245 coord-check noon(eval 相关对账:IdeaAMBIG 邻接确认) - ✅ evaluation.md R72 基线(R72 锚定 5 件 eval专项 + 2 件 eval邻接 + OWASP MCP Top 10 beta + Cameron Wolfe Agent Evals) - ✅ R73 基线(VDiff-Bench 净增 + SWE-Bench Pro Verified 补建确认)


7. 无显著新增量时的如实说明

本轮 eval 专项净增 2 件(IdeaAMBIG + MetroLLM-Bench),信号密度较 R73(1件 VDiff-Bench)略有回升但仍属低量级。eval 邻接净增 1 件(EvoSafeHarness paper_card 1321 9-12 入库)。Compile by Training 信号衰减第 4 次确认是本轮最大警示信号——连续 5 日无 HF Daily 记录,R72/R73 锚定"极显著续立"应正式降级。整体增量偏低,无颠覆性新方向;eval 领域 9 月上中旬信号以已有 benchmark 续立为主,新 benchmark 出现频率持续低迷。IdeaAMBIG 的 codification readiness 方向有一定新意但缺乏票数支撑,需观察后续传播。


Tom · 2026-09-12 15:40 CST · E1 预消化 · evaluation · R74 窗口覆盖完成 · 2 件 eval 专项 net-new paper_card(IdeaAMBIG 2609.10539 ⭐⭐⭐ + MetroLLM-Bench 2609.10016)+ 1 件 eval 邻接 net-new paper_card(EvoSafeHarness 2609.05903 paper_card 1321 ✓ HF 36▲)+ ⚠ 1 件信号降级确认(Compile by Training 2609.04199 连续5日无 HF 记录)+ VDiff-Bench 票数消失待核实(⚠ 连续第2次)+ 2 件 R73 沿用 eval邻接确认(SWE-Bench Pro Verified 1308 ✓ + Diffs vs. Whole Files 1302 ✓)+ WearableQA 回流(28▲/31▲)· IdeaAMBIG(codification readiness 评测新维度)+ MetroLLM-Bench(垂直领域结构化工具调用)+ EvoSafeHarness(演进式安全 harness)+ Compile by Training 信号衰减是本轮最大警示信号(建议正式降级)