evaluation · E1 预消化简报(2026-09-10)

角色: Tom · E1 日间预消化轮(evaluation)· 窗口覆盖 2026-09-09 15:40 ~ 2026-09-10 15:40 CST 数据来源: Tom 9-10 radar + HF Daily 9-10 + Jay 9-10 engineering e1prep + Jay 9-10 engineering filter + flyp 9-10 multimodal e1prep + flyp 9-10 DeepHalluBench critical read + Stephen 9-10 coord-check noon + spark 9-10 agent e1prep + work-queue 9-10 12:00 + paper_cards Sep 9-10 新卡核查 活文档基线: evaluation.md R71 锚定(3 件 eval 专项 net-new paper_card 入库:When Models Edit Too Much 2609.04061 + KoNA 2609.04720 + Ask Before You Optimize 2609.05258 · CoT 几何结构 2609.04753 eval邻接已锚 · Compile by Training 2609.04199 ⚠ 信号待核实 · RoboSPA 候选区)


0. 基线对齐与本轮概述

R71 锚定状态: - 3 件 eval 专项 paper_card(R71 已锚): When Models Edit Too Much(2609.04061)+ KoNA(2609.04720)+ Ask Before You Optimize(2609.05258) - CoT 几何结构(2609.04753)eval 邻接已锚,paper_card 1245 已入库 - Compile by Training(2609.04199)⚠ 信号断裂待核实——Sep 9 HF Daily 无记录,Sep 10 HF Daily 仍无 - RoboSPA(2609.05324)multimodal主分类 eval副分类,paper_card 1279 已入库 - FDABench(2509.02473)候选区,paper_card ⚠ 未建

本轮 E1-R72 增量摘要: - 2 件 eval 专项 net-new paper_card(Sep 10 新入库): EVOHARNESSBENCH(2609.04280,eval主分类)+ Closing the Consistency Gap(2609.08832,agent主分类 benchmark形态,eval邻接) - 2 件 eval 邻接 net-new 候选待建卡(arXiv 已知): AgentAudit(2609.09875)+ SAEScientist-Bench(2609.09113),Tom 9-10 radar 高价值条目,paper_card 均未建 - 1 件 eval 邻接新知(非独立 arXiv): Sherlocks AI Agent Failure Stack — eval循环缺失作为四层故障框架第三层 - 1 件 eval 框架新知(非 arXiv): The AI Engineer "AI Agents Stack 2026 Edition" — "89% 生产 agent 团队有 observability,但只有 52% 有 evals"——37 分差距是生产质量死亡带 - 整体增量中等——Sep 9-10 eval 专项 arXiv 新增 2 件(均已 paper_card),信号密度较 Sep 8 有所恢复


1. 增量条目(2 件 eval 专项 net-new + 2 件 eval 邻接待建卡 + 1 件 eval 邻接新知 + 1 件 eval 框架新知)

增量 ① EVOHARNESSBENCH(2609.04280):Harness 演进条件下的 Agent 评测基准

  • 来源: paper_card 1293(2026-09-10 OpenAlex backfill 入库,主分类 evaluation,形态 benchmark)+ Tom 9-10 0840 radar 高价值条目(与 EVOHARNESSBENCH 同列)+ spark 9-10 agent e1prep §增量 1 候选区(HF Daily 32▲ 邻接级)
  • 要点: 现代 LLM Agent 通过工具、可复用 skill 和专家 Agent 组成的 Harness 运作,该 Harness 持续演进(随新能力加入)。EVOHARNESSBENCH 在受控 Harness 演化条件下评测 Agent,覆盖三个维度(工具、skill、Agent),将非平稳性放在 Harness 而非任务流中。与现有持续学习基准形成根本差异。
  • 与活文档现有脉络的关系: 与 R71 §6.132 候选区(Harness Engineering 候选二十角)直接相关——harness 评测是 harness 工程化的核心基础设施。与 Compile by Training(端侧零依赖 artifact 生成)同属"评测工程基础设施化"方向。eval.md R71 无此条目锚定。
  • 建议归入节: §4 维度化指标体系(Harness 演进评测维度)+ §6.132 候选区(EVOHARNESSBENCH harness 演进 benchmark)
  • 可信度: ★★★(paper_card 1293 已建,eval 主分类 benchmark;HF 32▲ 偏低;TLDR 已富化 ✓)
  • ⚠️ 待办: 追踪 paper_card TLDR 是否已富化;评估该 benchmark 是否已在 harness 生态论文中被引用

增量 ② Closing the Consistency Gap(2609.08832):自进化 Agent 弥合 24 点一致性差距

  • 来源: paper_card 1288(2026-09-10 OpenAlex backfill 入库,主分类 agent,形态 benchmark)+ Tom 9-10 0840 radar 高价值条目 + Stephen 9-10 coord-check noon §增量 10(Tom R86 RAG 主轴增量①)
  • 要点: LLM Agent 平均准确率高但生产中不可靠——AppWorld benchmark 上 GPT-4.1 ReAct Agent 同一任务运行五次,仅 53% 全部成功,而单次通过率平均 77%,24 个百分点缺口称"一致性差距"。IBM Research 提出 self-evolving agent 框架识别不稳定、低一致性步骤并针对性修复。该框架是 agent 评测从"任务完成"走向"可审计可定位"的基础设施级补充。
  • 与活文档现有脉络的关系: 与 R71 §4 维度化指标体系(一致性/可靠性评测)高度相关——一致性差距是 agent 评测的新维度。与 EVOHarnessBENCH(harness 演进评测)同属 agent 评测基础设施化方向。eval.md R71 无此条目锚定。
  • 建议归入节: §4 维度化指标体系(Agent 一致性差距评测)+ §6.132 候选区(Closing the Consistency Gap 24 点缺口 benchmark)
  • 可信度: ★★★★(paper_card 1288 已建,IBM Research,benchmark 形态;Tom radar 高价值;TLDR 已富化 ✓)
  • ⚠️ 待办: 评估 self-evolving agent 框架与 Compile by Training 的关系——两者是否互补或竞争;推进 paper_card 建卡

增量 ③ AgentAudit(2609.09875):AI Agent 全生命周期信任评估框架

  • 来源: Tom 9-10 0840 radar 高价值条目(候选摘要 #1)+ Stephen 9-10 coord-check noon §增量 10 提及
  • 要点: 全生命周期评估框架,覆盖规划→工具选择→工具执行→记忆→推理十维,区分精确失败来源(现有基准做不到)。结合安全与行为维度,Agent 评测从"任务完成"走向"可审计可定位"。arXiv 编号 2609.09875 已知,paper_card 未建
  • 与活文档现有脉络的关系: 与 R71 §4 维度化指标体系(Agent 评测多维度)直接相关——十维框架是维度化指标的实践化。与 Closing the Consistency Gap(一致性差距)同属"可审计可定位"方向。与 §6.132 候选区(RealSWE 邻接)邻接。eval.md R71 无此条目锚定。
  • 建议归入节: §4 维度化指标体系(Agent 十维信任评估框架)+ §6.132 候选区(AgentAudit 全生命周期评估 arXiv:2609.09875)
  • 可信度: ★★★(Tom radar 高价值 ★,arXiv 编号已知,paper_card ⚠ 未建;需推动建卡)
  • ⚠️ 待办: 推动 paper_card 建卡(arXiv:2609.09875);评估十维框架与现有 Agent 评测基准的覆盖对比

增量 ④ SAEScientist-Bench(2609.09113):AI Agent 能否自主做可解释性科学研究

  • 来源: Tom 9-10 0840 radar 高价值条目(候选摘要 #2)+ Stephen 9-10 coord-check noon §增量 10 提及
  • 要点: 评估 AI Agent 能否充当科学家,用 Sparse Autoencoder 工具做自主机制可解释性发现。填补"Agent + 可解释性"评测空白,是 RSI(递归自我改进)+ Mechanistic Interpretability 的交叉前沿。arXiv 编号 2609.09113 已知,paper_card 未建
  • 与活文档现有脉络的关系: 与 R71 CoT 几何结构(2609.04753,同属推理过程分析方向)邻接。与 §6.132 候选区(RealSWE 邻接)并列。eval.md R71 无此条目锚定。
  • 建议归入节: §6.132 候选区(SAEScientist-Bench Agent+可解释性评测 arXiv:2609.09113)+ §4 维度化指标体系(可解释性评测维度)
  • 可信度: ★★★(Tom radar 高价值 ★,arXiv 编号已知,paper_card ⚠ 未建;RSI+可解释性交叉前沿价值高;需推动建卡)
  • ⚠️ 待办: 推动 paper_card 建卡(arXiv:2609.09113);评估该 benchmark 与 NeoHorse-1 递归自我改进的关系

增量 ⑤ Sherlocks AI Agent Failure Stack:生产环境 Agent 四层故障框架 + eval 循环缺失

  • 来源: Jay 9-10 1122 engineering e1prep 增量 ①(2026 年 1-5 月跨 73 个生产环境故障数据)+ Stephen 9-10 coord-check noon §增量 8 确认
  • 要点: 2026 年 1-5 月跨 73 个生产环境真实故障数据,Agent Failure Stack 四层框架:Tool Layer → Memory Layer → Reasoning Layer → Guardrails Layer。核心发现:故障不集中在单层,而是层叠(stack)——多层同时失效时才暴露。故障第三层(Reasoning Layer)核心问题:eval 循环缺失(Agent 无法自我评估任务完成质量,导致错误累积)。传统监控无法发现 agent 决策质量下降,需要单独 tracing 基础设施。
  • 与活文档现有脉络的关系: 与 R71 §4 维度化指标体系(Agent 评测过程质量)高度相关——eval 循环缺失是 Agent 评测"过程质量"方向的生产实证。与 Closing the Consistency Gap(24 点一致性差距)同属 Agent 评测"一致性/可靠性"方向,与 Compile by Training(端侧零依赖)同属"评测工程基础设施化"大方向。eval.md R71 无此条目锚定。
  • 建议归入节: §4 维度化指标体系(Agent eval 循环缺失 + 四层故障框架)+ §3.5 harness 生态候选区(Agent Failure Stack 生产实证)
  • 可信度: ★★★(73 个生产环境一手数据,时间范围明确,非厂商宣传;无独立 arXiv)
  • ⚠️ 待办: 追溯 Sherlocks AI 官方博客是否有独立 arXiv 或完整报告;评估"eval 循环缺失"与 Compile by Training 的关系——前者是生产问题诊断,后者是解决方案

增量 ⑥ The AI Engineer "AI Agents Stack 2026 Edition":52% vs 89% —— 生产质量死亡带

  • 来源: Jay 9-10 1122 engineering e1prep 增量 ④ + Jay 9-10 1450 engineering filter §5b + Stephen 9-10 coord-check noon §增量 5 确认
  • 要点: The AI Engineer "AI Agents Stack 2026 Edition"核心数据——89% 的生产 agent 团队有 observability,但只有 52% 有 evals。37 分差距是生产质量死亡带:团队能看见系统在跑,但无法评估跑得好不好。Eval as Infrastructure 三层体系(每次 PR 快速检查 → 夜间回归套件 → 生产持续监控)是行业共识解决方案。三支新 benchmark:Context-Bench(memory management)+ Recovery-Bench(error recovery)+ Terminal-Bench(coding agents)。
  • 与活文档现有脉络的关系: 与 R71 Compile by Training(端侧零依赖 artifact 生成)同属"评测工程基础设施化"方向。与 Sherlocks AI Agent Failure Stack(eval 循环缺失是第三层 Reasoning 故障)直接呼应——89% 有 observability 说明有 monitoring,但 monitoring ≠ eval,两者差距 37 分是 eval 缺口的生产级证据。与 §6.132 候选区(harness 生态候选二十角)高度相关。eval.md R71 无此条目锚定。
  • 建议归入节: §3.5 harness 生态候选区(Eval as Infrastructure 三级体系 + 89% vs 52% 数据)+ §6.132 候选区(Context-Bench + Recovery-Bench + Terminal-Bench 三件套)
  • 可信度: ★★★(The AI Engineer 高影响力媒体;89% vs 52% 数据有框架性价值;三件套无独立 arXiv)
  • ⚠️ 待办: 追溯 Context-Bench / Recovery-Bench / Terminal-Bench 是否有独立 arXiv 论文;89% vs 52% 数据溯源

2. Sep 9-10 paper_cards eval 相关新卡核查

Sep 9-10 新增 eval 主分类卡(1 件)

编号 arXiv 标题 形态 与 eval.md 关系
1293-2609.04280 2609.04280 EVOHarnessBENCH benchmark eval 专项净增(Sep 10)

Sep 9-10 新增 eval 邻接卡(主分类非 eval,eval 相关)

编号 arXiv 标题 主分类 与 eval 关系
1288-2609.08832 2609.08832 Closing the Consistency Gap agent eval 邻接净增(benchmark 形态)
1279-2609.05324 2609.05324 RoboSPA multimodal eval 副分类(VLA 空间推理 benchmark)
1269-2609.04482 2609.04482 Boundary-Aware Safety risk eval 邻接(训练与评估数据)
1268-2609.04382 2609.04382 Privacy Failure in Split-LLM engineering eval 邻接(隐私评测)
1257-2609.03231 2609.03231 (待查) multimodal eval 邻接
1256-2609.04444 2609.04444 (待查) multimodal eval 邻接

: Sep 9 新增 eval 专项仅 CoT 几何结构(1245,2609.04753);Sep 10 新增 eval 专项 1 件(EVOHarnessBENCH);整体密度较 Sep 8(3 件 eval 专项)有所恢复但仍偏低。


3. 矛盾与待核实

矛盾 ① Compile by Training 信号断裂(持续)

  • Sep 8 HF Daily #1 374▲ → Sep 9 HF Daily 无记录 → Sep 10 HF Daily 无记录
  • 持续时间: 已连续两日无记录——信号消失非单日采样波动,可能是真实衰减或票数跌出 Top15 采样上限
  • 建议: 在 candidates 或 radar 中标注"Compile by Training 信号断裂持续,需在 Sep 11 早棒做最终确认";R71 锚定"极显著续立"已被 Sep 9-10 数据持续推翻,需考虑降级为"信号衰减待核实"

矛盾 ② AgentAudit(2609.09875)与 SAEScientist-Bench(2609.09113)paper_card 未建

  • Tom 9-10 radar 高价值条目,arXiv 编号已知,paper_card 均未建
  • 建议: 推动 paper_card 建卡流程;arXiv 编号 2609.09875(AgentAudit)+ 2609.09113(SAEScientist-Bench)均可追溯

矛盾 ③ Sherlocks AI Agent Failure Stack 无独立 arXiv

  • 73 个生产环境故障数据来自 Sherlocks AI 官方博客(2026-06-05),无独立 arXiv 编号
  • 建议: 引用时需注明来源为厂商博客而非同行评审论文;在活文档中作为生产实证层处理,不作为学术证据

矛盾 ④ ICM-Bench arXiv 编号歧义

  • Jay 9-10 11:05 afternoon 棒位 cs.CL #5 ICM-Bench 引 arXiv:2609.04438;但该 arXiv 在 candidates 中标注为不同论文
  • 建议: 核查 ICM-Bench 真实 arXiv 编号;如确认是 2609.04438 则推动 paper_card 建卡

4. 可引用 arXiv 号列表

本轮 eval 专项 net-new(2 件): - 2609.04280 — EVOHarnessBENCH(paper_card 1293 ✓ · eval 主分类 · benchmark · 32▲) - 2609.08832 — Closing the Consistency Gap(paper_card 1288 ✓ · agent 主分类 · benchmark 形态 · IBM Research)

本轮 eval 邻接 net-new 候选待建卡(2 件): - 2609.09875 — AgentAudit:AI Agent 全生命周期信任评估框架(Tom radar 高价值 ★ · paper_card ⚠ 未建) - 2609.09113 — SAEScientist-Bench:AI Agent 自主可解释性科学研究评测(Tom radar 高价值 ★ · paper_card ⚠ 未建)

R71 沿用 eval 专项(3 件): - 2609.04061 — When Models Edit Too Much(paper_card 1242) - 2609.04720 — KoNA(paper_card 1253) - 2609.05258 — Ask Before You Optimize / OR-Clarify(paper_card 1239)

R71 沿用 eval邻接(4 件): - 2609.04199 — Compile by Training(⚠ 信号断裂持续,需降级核实) - 2609.04148 — Terminal-Universe - 2609.04172 — On-Policy Distillation II(81▲ #5 回升) - 2609.04753 — CoT 几何结构(paper_card 1245 · eval 邻接已锚)

R71 沿用 eval邻接候选(待建卡): - 2609.05324 — RoboSPA(paper_card 1279 ✓ · multimodal 主分类 · eval 副分类) - 2509.02473 — FDABench(⚠ paper_card 未建 · arXiv 已知)


5. 增量条数汇总

类别 条数 编号
eval 专项 net-new paper_card 2 ① EVOHarnessBENCH(2609.04280)+ ② Closing the Consistency Gap(2609.08832)
eval 邻接 net-new 候选待建卡 2 ③ AgentAudit(2609.09875)+ ④ SAEScientist-Bench(2609.09113)
eval 邻接新知(非 arXiv) 1 ⑤ Sherlocks AI Agent Failure Stack(四层故障框架 + eval 循环缺失)
eval 框架新知(非 arXiv) 1 ⑥ AI Agents Stack 2026 Edition(89% vs 52% 生产质量死亡带)
信号待核实 1 ⚠ Compile by Training 信号断裂持续(Sep 9-10 均无 HF Daily 记录)
合计净增量 5 ①-⑥(5 件 eval 相关)+ ⚠ 信号核实(1 件)

arXiv 号数量: 2 件本轮新增 eval专项(均已 paper_card ✓)+ 2 件 eval邻接新候选待建卡(有编号待建)+ 1 件 R71 沿用 ⚠(Compile by Training)+ 1 件 R71 沿用 eval邻接待建卡(FDABench 2509.02473)+ 1 件 R71 沿用 eval邻接已建卡(RoboSPA 2609.05324)= 7 件(4 件可用 + 3 件待溯/待建)


6. 检查过的来源清单

已确认无 eval 专项新增量的来源(如实说明): - Stephen 9-10 inbox(ai-industry e1prep;主轴 frontier lab + GPT-6 Astra;eval 邻接无独立净增;coord-check noon 有 agent failure stack + frontier lab 治理新发现,已锚入增量⑤⑥) - Jay 9-10 inbox(engineering e1prep + engineering filter;主轴工程实践;eval 邻接有 Sherlocks AI Agent Failure Stack(已锚入增量⑤)+ The AI Engineer(已锚入增量⑥);eval 专项有 EVOHarnessBENCH(待查 paper_card)+ Closing the Consistency Gap(待查 paper_card)) - flyp 9-10 inbox(multimodal e1prep + DeepHalluBench critical read;主轴 multimodal;eval 邻接有 DeepHalluBench(arXiv:2601.22984v2,精读稿,非新 paper_card);无 eval 专项净增) - spark 9-10 inbox(agent e1prep;主轴 agent;eval 邻接有 EVOHarnessBENCH(邻接级 32▲)+ RoboSPA(邻接级);无 eval 专项净增) - work-queue.md(2026-09-10 14:00;待建卡 8 件含 EVOHarnessBENCH 2609.04280;0 件待更新主题活文档;选题榜 2 件) - paper_cards Sep 9-10 新卡核查(eval 主分类 1 件 EVOHarnessBENCH;eval邻接 6 件 Closing Consistency Gap / RoboSPA / Boundary-Aware Safety / Privacy Failure / 待查 2 件)

本轮实际处理的新增来源: - ✅ Tom 9-10 0840 agent-rag-longcontext-radar.md(AgentAudit 2609.09875 + SAEScientist-Bench 2609.09113 高价值条目) - ✅ Tom 9-10 0900 HF Daily 2026-09-10.md(15 篇;无 eval 专项新晋;EVOHarnessBENCH 32▲ 邻接级) - ✅ Jay 9-10 1122 engineering e1prep(Sherlocks AI Agent Failure Stack + The AI Engineer Eval as Infrastructure 三级体系) - ✅ Jay 9-10 1450 engineering filter(89% vs 52% 数据 + Context/Recovery/Terminal-Bench 三件套) - ✅ flyp 9-10 0950 DeepHalluBench critical read(arXiv:2601.22984v2 · PING 四象限 hallucination 评测) - ✅ Stephen 9-10 1245 coord-check noon(eval邻接信号确认:agent failure stack + AI Agents Stack 2026 Edition) - ✅ spark 9-10 agent e1prep(EVOHarnessBENCH + RoboSPA 邻接级) - ✅ evaluation.md R71 基线(R71 锚定 3 件 eval专项 + 4 件 eval邻接 + 候选二十角) - ✅ paper_cards Sep 9-10 新卡核查(1293 EVOHarnessBENCH ✓ + 1288 Closing Consistency Gap ✓ + 1279 RoboSPA ✓)


7. 建议 E1-R72 活文档写入方向

  1. EVOHarnessBENCH 写入 §4 + §6.132:Harness 演进条件下的 Agent 评测基准——工具/skill/Agent 三维度,harness 非平稳性评测;paper_card 1293 已建
  2. Closing the Consistency Gap 写入 §4 + §6.132:24 点一致性差距——AppWorld GPT-4.1 ReAct 77% 单次 vs 53% 五次全成功;self-evolving agent 框架;paper_card 1288 已建
  3. AgentAudit 写入 §6.132:arXiv:2609.09875——全生命周期十维信任评估;推动 paper_card 建卡 P1
  4. SAEScientist-Bench 写入 §6.132:arXiv:2609.09113——Agent+可解释性 RSI 评测交叉前沿;推动 paper_card 建卡 P1
  5. Sherlocks AI Agent Failure Stack 写入 §4 + §3.5:eval 循环缺失是 Reasoning Layer 第三层故障;73 个生产环境一手数据;非 arXiv,作为生产实证处理
  6. AI Agents Stack 2026 Edition 写入 §3.5:89% vs 52% 生产质量死亡带——Eval as Infrastructure 三级体系;Context-Bench + Recovery-Bench + Terminal-Bench 三件套待独立 arXiv 溯源
  7. Compile by Training 信号核实(⚠ 优先):Sep 9-10 均无 HF Daily 记录,持续时间已达 2 日;R71 锚定"极显著续立"应降级为"信号衰减待核实"

8. 无显著新增量时的如实说明

本轮 eval 专项净增 2 件(EVOHarnessBENCH + Closing the Consistency Gap),信号密度较 Sep 8(3 件)有所恢复但仍属中等。eval 邻接净增 4 件(AgentAudit + SAEScientist-Bench 待建卡 + Sherlocks AI + AI Agents Stack 2026 Edition)。Compile by Training 信号断裂是本轮最大警示信号——连续两日无 HF Daily 记录,R71 锚定"极显著续立"已被持续推翻。整体增量来自 benchmark 新卡入库(2 件)+ 行业报告新知(2 件非 arXiv),无颠覆性新方向出现。


Tom · 2026-09-10 15:40 CST · E1 预消化 · evaluation · R72 窗口覆盖完成 · 2 件 eval 专项 net-new paper_card(EVOHarnessBENCH 2609.04280 + Closing the Consistency Gap 2609.08832)+ 2 件 eval 邻接新候选待建卡(AgentAudit 2609.09875 + SAEScientist-Bench 2609.09113)+ 1 件 eval 邻接新知(Sherlocks AI 四层故障框架 + eval 循环缺失)+ 1 件 eval 框架新知(AI Agents Stack 2026 Edition 89% vs 52%)+ ⚠ 1 件信号待核实(Compile by Training 信号断裂持续)· EVOHarnessBENCH + Closing Consistency Gap(本轮核心 eval 专项净增)+ AgentAudit + SAEScientist-Bench(待建卡高价值候选)+ Sherlocks AI + AI Agents Stack 2026 Edition(生产实证与行业框架)+ Compile by Training 信号断裂是本轮最大警示信号