evaluation · E1 预消化简报(2026-09-18)

角色:Tom · E1 日间预消化轮(evaluation)· 窗口覆盖 2026-09-17 15:40 ~ 2026-09-18 15:40 CST 数据来源:Tom 9-17 evaluation e1prep 基线(R77)+ Jay 9-17/18 engineering-e1prep + Jay 9-17/18 engineering-filter(AutoTuneBench/AgentSysBench)+ Stephen 9-18 ai-industry e1prep + paper_cards 1400-1416 批次 + HF Daily 9-17/18 + Tom 9-18 0840/1440 radar + work-queue 9-18 14:00 活文档基线:evaluation.md R77 锚定(240 arXiv ID · MC-Search 2603.00873 + ImpossibleRubrics 2609.16816 + HarnessVLN 2609.15195 + ModularRSI 2609.14857 + Emergence World 2609.17320 + Register Tokens 2609.11873)


0. 基线对齐与本轮概述

R77→R78 锚定状态: - 6 件 R77 eval 专项/邻接锚入稳态沿用 - R77 新增 MC-Search(2603.00873,ICLR 2026 ✓)paper_card 仍未入库(仅 critical-read 完成)⚠️ P0 - R77 矛盾 ImpossibleRubrics vs MC-Search HAVE 框架:尚未有实测交叉核实

本轮 E1-R78 增量摘要: - 1 件 eval 专项 paper_card 新入库候选(AutoTuneBench 2609.18123,Jay engineering-filter 标注为 eval 高价值条目,但 paper_card 尚未入库) - 1 件 eval 邻接/benchmark paper_card 新入库候选(AgentSysBench 2608.15127,Jay engineering-filter 标注为 benchmark 工具,paper_card 状态待确认) - 1 件 eval 邻接 ACL 2026 新信号(EDGE-EVAL 工业部署指标框架) - eval 领域整体信号密度较低:R77 的 ImpossibleRubrics vs MC-Search 矛盾未出现新进展;HF Daily Top15 中 eval 专项条目消失(Game AI arXiv:2609.16679 为 agent+evaluation 双分类,非 eval 专项) - LangChain State of Agent Engineering 2026:89% 团队有 observability,仅 52% 有 evals——37-point gap 是 eval 基础设施缺口量化证据


1. 增量条目(3 件 eval 邻接新信号 + 1 件 HF 信号状态更新)

增量 ① AutoTuneBench arXiv:2609.18123 · 可信测量协议 · 5% CV cap + Anti-cheat · paper_card 未入库 ⚠️

  • 来源:Jay 2026-09-17T1450-jay-engineering-filter-sep17.md(9-17 engineering-filter 高价值条目 #2)+ Jay 2026-09-18T1050-jay-engineering-filter.md(9-18 engineering-filter 引用)+ work-queue 9-18 14:00(无 eval 专项净新增警告,与本条一致:paper_card 未入库⚠️)
  • arXiv 号arXiv:2609.18123 AutoTuneBench: Trustworthy Measurement for Agent Auto-Tuning
  • 要点
  • 核心问题:Agent auto-tuning 的测量存在系统性失败模式,现有方法无法保证可信、可复现的评测结果
  • 4 种测量失败模式:① strawman baselines(使用过弱的 baseline 使结果失去意义);② 绝对时间不可迁移(不同硬件环境下 latency 数字无法对比);③ 其他测量协议缺陷
  • 5% CV cap:变异系数(CV = 标准差/均值)上限 5%,超过则测量结果不可信
  • Anti-cheat 检查:检测 agent 是否在评测表面之外作弊("outside agent surface"),防止 agent 通过针对评测机制本身而非任务本身来"作弊"
  • 实证数据:619 次 model calls 实测;诚实 baseline rewrite 案例:10.6x → 2.03x(修正 strawman baseline 后差异大幅缩小)
  • 开源:测量协议代码已开源,可验证、可复现
  • 与活文档现有脉络的关系:R77 §3.3 评测平台与 CI Gate(0 件 net-new);AutoTuneBench 与 Benchmark Radar(元评测基础设施)、Ops II(评测工程化)同属"评测基础设施诚信化"方向;AutoTuneBench 的"5% CV cap + Anti-cheat"是 eval 诚信领域的具体可操作标准
  • 建议归入节:evaluation.md §3.3 评测平台与 CI Gate(AutoTuneBench 作为可信测量协议候选第 101 条)+ §7.3 开放问题(测量协议标准化)
  • 可信度:⭐⭐⭐⭐(Jay engineering-filter 高价值标注 + 619 calls 实测 + 5% CV cap 具体可操作 + Anti-cheat 概念清晰 + 协议代码开源)
  • ⚠️ 待核实:paper_card 是否已入库(搜索 paper_cards 未找到 2609.18123);具体 4 种测量失败模式的详细分类;5% CV cap 在不同 benchmark 类型上的适用性

增量 ② AgentSysBench arXiv:2608.15127 · Agentic Workloads 生产级基准测试 · 178,799 sessions · paper_card 状态待确认

  • 来源:Jay 2026-09-17T1450-jay-engineering-filter-sep17.md(9-17 engineering-filter 高价值条目 #1)+ Jay 2026-09-18T1050-jay-engineering-filter.md(9-18 engineering-filter Inference Systems 章节引用)+ Stephen 2026-09-18-ai-industry-e1prep.md(§2.84 Anthropic 评测方法学邻接)
  • arXiv 号arXiv:2608.15127 AgentSysBench: LLM Inference to Agentic Workloads
  • 要点
  • 生产级 benchmark:10 个 agentic 应用 benchmark,基于真实生产 sessions 而非合成数据
  • 规模:178,799 个生产 sessions;4,641 个 benchmark requests;64,924 个 LLM calls;118,274 个 tool calls
  • 6 大关键发现(摘要级):
    1. 非 LLM 组件主导延迟(non-LLM latency dominates)——Agent 系统中 LLM 之外的组件(工具调用、网络 IO、状态管理)是主要延迟来源
    2. Tool-result caching 可节省 35.2% 的冗余搜索
    3. Sandbox working-set 峰值 28GB/session
    4. 生产 idle 时间分布(具体数字待查)
  • Benchmark toolkit 开源:可复现、可直接使用
  • 与活文档现有脉络的关系:R77 §3.3 评测平台与 CI Gate(0 件 net-new);AgentSysBench 与 AutoTuneBench 同属"评测基础设施诚信化"方向;与 Emergence World(2609.17320,长程多 Agent 压力测试)形成"生产基准 + 对抗性压力测试"的评测双轨
  • 建议归入节:evaluation.md §3.3 评测平台与 CI Gate(AgentSysBench 作为生产级 agentic benchmark 候选第 102 条)+ §4 维度化指标体系(非 LLM 延迟主导维度)
  • 可信度:⭐⭐⭐⭐(Jay engineering-filter 高价值标注 #1 + 生产级真实 trace + 量化数据具体 + toolkit 开源)
  • ⚠️ 待核实:paper_card 是否已入库(搜索 paper_cards 1400-1416 批次未找到 2608.15127);6 大关键发现的具体数字;non-LLM latency 的具体占比

增量 ③ EDGE-EVAL arXiv:??? · ACL Anthology 2026 · 工业部署全生命周期指标框架 · Tesla T4 GPU benchmark

  • 来源:Jay 2026-09-17T1450-jay-engineering-filter-sep17.md(engineering-filter 高价值条目 #23)+ Jay 2026-09-18T1050-jay-engineering-filter.md(9-18 engineering-filter 引用)
  • arXiv 号:⚠️ 待查(ACL Anthology 2026 论文,Jay engineering-filter 未标注具体 arXiv 号)
  • 要点
  • 核心贡献:面向工业部署场景的 eval 框架,填补"实验室 benchmark vs 真实部署"之间的鸿沟
  • 5 个工业部署指标:Nbreak / IPW / ρsys / Ctax / Qret(名称含义待查,对应 Tesla T4 legacy GPU 环境)
  • Tesla T4 legacy GPU 真实 benchmark 数据:LLaMA-3.2-1B INT4 在 Tesla T4 上 14 requests 达到 ROI break-even;6,930 tokens/s/GB
  • QLoRA 增加 6-7x adaptation energy:量化对能效的影响
  • 与 EDD(Eval-Driven Development)的关联:提供工业部署全生命周期的可量化指标,是 EDD 在生产环境的实证基础
  • 与活文档现有脉络的关系:R77 §3.3 评测平台与 CI Gate(0 件 net-new);EDGE-EVAL 填补了"实验室评测 vs 工业部署"的 eval 缺口;与 AutoTuneBench(测量协议)和 AgentSysBench(生产 benchmark)构成 eval 诚信三件套:协议 + 生产 benchmark + 工业部署指标
  • 建议归入节:evaluation.md §3.3 评测平台与 CI Gate(EDGE-EVAL 作为工业部署评测候选第 103 条,⚠️ arXiv 号待查)+ §4 维度化指标体系(工业部署指标维度)
  • 可信度:⭐⭐⭐(Jay engineering-filter 高价值标注 + ACL 2026 同行评审 + Tesla T4 具体 benchmark 数字)
  • ⚠️ 待核实:具体 arXiv 号;5 个指标(Nbreak/IPW/ρsys/Ctax/Qret)的具体含义;Tesla T4 ROI break-even 的具体条件

增量 ④ LangChain State of Agent Engineering 2026 · 89% vs 52% eval gap · eval 基础设施缺口量化证据

  • 来源:Jay 2026-09-18T1050-jay-engineering-filter.md(9-18 engineering-filter · The AI Engineer Substack · Layer 3 memory)+ Stephen 2026-09-18-ai-industry-e1prep.md(9-18 noon 棒位 · 协调棒引用)
  • 要点
  • 关键数据:LangChain State of Agent Engineering 2026 调查显示,89% 的团队已有某种形式的 observability(可观测性),但仅有 52% 的团队有 evals(评测)——37-point gap
  • 含义:大多数 Agent 团队能"看见"系统运行,但无法"评估"系统质量;这是 eval 基础设施缺口在行业层面的首次量化确认
  • 与 R77 §3.3 评测平台与 CI Gate 的关系:Benchmark Radar(元评测基础设施)、AutoTuneBench(可信测量协议)、AgentSysBench(生产 benchmark)都在填补这个 37-point gap;eval-as-infrastructure(Jay 9-17 engineering-filter)是填补路径之一
  • 与活文档现有脉络的关系:R77 §3.3 评测平台与 CI Gate(已有 Benchmark Radar + Eval-as-Infra 锚入);89% vs 52% 是 eval 基础设施缺口首次行业级量化确认
  • 建议归入节:evaluation.md §3.3 评测平台与 CI Gate(89% vs 52% gap 作为 eval 基础设施缺口的量化证据)+ §7.3 开放问题(行业级 eval 基础设施标准化)
  • 可信度:⭐⭐⭐⭐(LangChain State of Agent Engineering 2026 是行业权威调研;具体数字来源可溯源)
  • ⚠️ 待核实:52% 有 evals 的具体定义(是指有 formal eval 系统,还是有 ad-hoc 评测);89% observability 的具体测量方式

增量 ⑤ HF Daily 9-17/18 eval 相关条目信号状态更新

arXiv 标题 9-17 票数 9-18 票数 变化 备注
2609.16679 基础模型时代的游戏 AI 107▲ 113▲ +6▲,排名稳定 agent+evaluation 双分类,非 eval 专项
2609.11873 人类构建的最后一个 AI 86▲ #6 88▲ +2▲,排名稳定 agent 主分类,eval 邻接
2609.06107 DataFlex-RL 未入 Top15 未入 Top15 ⚠️ 9-16 后未回榜 eval 邻接,R77 已锚
2609.11115 Benchmark Radar 未入 Top15 未入 Top15 连续 3 日无回榜 eval 邻接,R77 已锚
2609.15364 RSIAgent 70▲ #8 未入 Top15 ⚠️ 9-18 退出 agent 主轴 RSI,eval 邻接关注
2609.04199 Compile by Training 未入 Top15 未入 Top15 连续 11 日断 ⚠⚠ 建议正式归档

要点:eval 专项/邻接在 HF Top15 的可见性 9-18 进一步下降;Game AI(2609.16679,agent+evaluation)继续在榜但主分类为 agent;RSIAgent 退出 Top15;DataFlex-RL 和 Benchmark Radar 持续无回榜


2. 矛盾与待核实

矛盾 ① ⚠⚠ ImpossibleRubrics vs MC-Search HAVE 框架 —— R77 未解决,本轮无新进展

  • 状态:R77 提出的方法学层面系统性冲突,本轮 inbox 来源中未出现新进展或交叉核实
  • Stephen 9-18 noon 协调棒:未提及该矛盾的核实状态
  • 建议:§7.3 开放问题保持 P0 标记,R79 前需完成实测交叉核实

待核实 ①:AutoTuneBench paper_card 入库状态

  • Jay 9-17/18 engineering-filter 高价值条目,但 paper_cards 1400-1416 批次未找到 2609.18123
  • 建议:evaluation.md §3.3 候选标注 ⚠️ paper_card 未入库

待核实 ②:AgentSysBench paper_card 入库状态

  • Jay 9-17/18 engineering-filter 高价值条目,但 paper_cards 1400-1416 批次未找到 2608.15127
  • 建议:evaluation.md §3.3 候选标注 ⚠️ paper_card 未入库

待核实 ③:EDGE-EVAL 具体 arXiv 号

  • Jay engineering-filter 仅标注"ACL Anthology 2026",未提供 arXiv 号
  • 建议:入库时补充具体 arXiv 号

待核实 ④:89% vs 52% eval gap 的具体定义

  • LangChain State of Agent Engineering 2026 具体调研方法和定义需查证
  • 建议:§3.3 评测平台候选标注 ⚠️ 具体定义待查

3. Sep 16-18 paper_cards eval 相关新卡核查

Sep 16-18 新增 eval 主分类卡(0 件)

  • 1400-1416 批次(共 17 张)主分类分布:agent(9 件)+ llm-infra(4 件)+ multimodal(2 件)+ engineering(2 件)+ risk(1 件)+ rag(1 件)
  • eval 主分类 0 件——本批次无 eval 专项 paper_card 新入库

Sep 16-18 eval 邻接卡(推测)

编号 arXiv 标题 主分类 eval 关系
1400 2609.13406 广义 Agent 迭代:迭代策略改进与递归自改进的统一形式化框架 agent eval 邻接(Generalized Policy Iteration for RSI,eval 邻接 R77 Register Tokens 同类)
1405 2609.17708 置信来自经验:从推理到 Agent 的经验性置信估计 agent eval 邻接(置信校准,eval 核心维度)
1414 2609.15524 在 BraTS-GoAT 2026 中评估 nnU-Net 跨脑肿瘤人群的泛化能力 llm-infra eval 邻接(医学图像分割泛化评估,nnU-Net 非 LLM 但 eval 方法可参考)

说明:本批次无 eval 主分类 paper_card 入库,eval 专项信号低谷期持续


4. 可引用 arXiv 号列表

本轮 eval 专项新锚候选(1 件): - 2609.18123 — AutoTuneBench(⚠️ paper_card 未入库 · 可信测量协议 · 5% CV cap · Anti-cheat · 619 calls 实测 · protocol code open source · ⭐⭐⭐⭐)

本轮 eval 邻接新锚候选(2 件): - 2608.15127 — AgentSysBench(⚠️ paper_card 状态待确认 · 生产级 agentic benchmark · 178,799 sessions · tool caching 35.2% · ⭐⭐⭐⭐) - EDGE-EVAL — ACL Anthology 2026(⚠️ arXiv 号待查 · 工业部署全生命周期指标框架 · Tesla T4 benchmark · ⭐⭐⭐)

本轮 eval 相关量化证据(1 件): - LangChain State of Agent Engineering 2026 — 89% observability vs 52% evals(37-point gap)

R77 沿用 eval 专项/邻接(6 件): - 2603.00873 — MC-Search(ICLR 2026 ✓ · 首个 Agentic MM-RAG 过程级基准 · ⭐⭐⭐⭐ · ⚠️ paper_card 未入库) - 2609.16816 — ImpossibleRubrics(paper_card 1388 ✓ · LLM-as-Judge rubric 对抗鲁棒性 · ⭐⭐⭐⭐) - 2609.15195 — HarnessVLN(paper_card 1389 ✓ · 零样本具身导航 harness · ⭐⭐⭐) - 2609.14857 — ModularRSI(paper_card 1390 ✓ · 模块化可泛化 Harness 自我改进 · ⭐⭐⭐) - 2609.17320 — Emergence World(paper_card 1380 ✓ · 多智能体长程故障级联压力测试) - 2609.11873 — 人类构建的最后一个 AI(paper_card 1387 ✓ · RSI 议题核心 · HF 88▲)

R77 沿用 eval 邻接无 HF 回榜(5 件): - 2609.06107 — DataFlex-RL(⚠️ 连续 2 日未入 Top15) - 2609.11115 — Benchmark Radar(⚠️ 连续 3 日未入 Top15) - 2609.10539 — IdeaAMBIG(⚠️ 9-15 后无 HF 记录) - 2609.10016 — MetroLLM-Bench(⚠️ 9-15 后无 HF 记录) - 2609.05903 — EvoSafeHarness(⚠️ 9-15 后无 HF 记录)

正式归档候选(1 件): - 2609.04199 — Compile by Training(⚠️ 连续 11 日无 HF 记录,建议从"已沉寂"正式归档为历史锚入条目)


5. 增量条数汇总

类别 条数 编号
eval 专项新锚候选 1 ① AutoTuneBench(2609.18123,⚠️ paper_card 未入库)
eval 邻接新锚候选 2 ② AgentSysBench(2608.15127,⚠️ paper_card 待确认)+ ③ EDGE-EVAL(ACL 2026,⚠️ arXiv 号待查)
eval 相关量化证据 1 ④ 89% vs 52% eval gap(LangChain State of Agent Engineering 2026)
HF 信号更新 1 ⑤ Game AI(2609.16679,agent+evaluation 双分类)+ RSIAgent/Compile by Training 状态
正式归档候选 1 ⑥ Compile by Training(连续 11 日断)
合计净增量 3 ① AutoTuneBench + ② AgentSysBench + ③ EDGE-EVAL + ④ 89% vs 52% gap + ⑤ HF 信号 = 5 件(但 paper_card 均未入库或待确认)

arXiv 号数量:1 件 eval 专项新锚候选(2609.18123)+ 1 件 eval 邻接新锚候选待确认(2608.15127)+ 1 件 arXiv 号待查(EDGE-EVAL)+ 6 件 R77 沿用 + 5 件 R77 沿用无 HF + 1 件归档候选 = 15 件


6. 检查过的来源清单

已确认处理过的来源(如实说明): - ✅ Tom 9-17 evaluation e1prep(R78 基线,6 件 eval 专项/邻接锚定 + 2 件待审核) - ✅ Jay 9-17/18 engineering-e1prep(AutoTuneBench + AgentSysBench 高价值条目 + EDGE-EVAL) - ✅ Jay 9-17T1450 engineering-filter(AutoTuneBench #2 + AgentSysBench #1 + EDGE-EVAL #23) - ✅ Jay 9-18T1050 engineering-filter(AutoTuneBench + AgentSysBench 引用 + 89% vs 52% gap) - ✅ Stephen 9-18 ai-industry e1prep(Anthropic 评测方法学邻接 + arXiv:2609.16679 Game AI) - ✅ paper_cards 1400-1416 批次(共 17 张,eval 主分类 0 件,eval 邻接 3 件:1400/1405/1414) - ✅ HF Daily Sep 17/18(Game AI 107→113▲ + 人类构建的最后一个 AI 88▲;eval 专项消失) - ✅ Tom 9-18 0840/1440 radar(candidates 核查) - ✅ work-queue 9-18 14:00(无 eval 专项净新增警告,与 AutoTuneBench/AgentSysBench paper_card 未入库一致) - ✅ evaluation.md R77 基线(240 arXiv ID)


7. 无显著新增量时的如实说明

本轮 eval 专项净增 1 件 paper_card 新入库候选(AutoTuneBench 2609.18123),但 paper_card 尚未入库;eval 邻接净增 2 件 benchmark 信号(AgentSysBench + EDGE-EVAL),paper_card 状态均待确认;eval 领域整体信号密度低于 R77。

信号质量评估: - AutoTuneBench(2609.18123)是本轮最高价值 eval 专项候选,5% CV cap + Anti-cheat 提供具体可操作的可信评测标准,但 paper_card 未入库是主要障碍——建议 R79 前确认为 paper_card 优先入库目标 - AgentSysBench(2608.15127)是生产级 agentic benchmark,与 AutoTuneBench 形成"测量协议 + 生产 benchmark"互补,但 paper_card 状态待确认 - EDGE-EVAL(ACL 2026)填补"实验室 vs 工业部署"评测缺口,但 arXiv 号缺失 - 本轮最大发现:LangChain State of Agent Engineering 2026 的 89% vs 52% gap 是 eval 基础设施缺口的首次行业级量化——Benchmark Radar + AutoTuneBench + AgentSysBench + EDGE-EVAL 都在填补这个 37-point gap - eval 领域信号低谷期持续:HF Top15 中 eval 专项消失,paper_cards 1400-1416 批次 0 件 eval 主分类

R78 活文档建议关注:① AutoTuneBench paper_card 入库进度(P0);② AgentSysBench paper_card 入库进度;③ EDGE-EVAL arXiv 号查证;④ 89% vs 52% eval gap 具体定义溯源;⑤ ImpossibleRubrics vs MC-Search HAVE 矛盾的实测核实(持续 P0);⑥ Compile by Training 11 日断是否触发正式归档


Tom · 2026-09-18 15:40 CST · E1 预消化 · evaluation · R78 窗口覆盖完成 · 1 件 eval 专项新锚候选(AutoTuneBench 2609.18123,⚠️ paper_card 未入库)+ 2 件 eval 邻接 benchmark 新信号(AgentSysBench 2608.15127 + EDGE-EVAL ACL 2026)+ 1 件量化证据(89% vs 52% eval gap)+ 1 件 HF 信号更新 + 1 件归档候选(Compile by Training 11 日断)+ ⚠️ ImpossibleRubrics vs MC-Search HAVE 矛盾持续 P0