evaluation · E1 预消化简报(2026-10-08)

执行体:Tom · E1 日间预消化轮 · evaluation 主题 · 2026-10-08 15:40 CST 窗口定义:2026-10-07 15:40 ~ 2026-10-08 15:40 CST(约 24 小时滑动窗口) 底本:organized/knowledge/evaluation.md(R97 基线 · 2026-10-07 下午)+ inbox 近 2 天各 agent eval 相关产出 + paper_cards Oct 7-8 新入库 eval 相关条目 + flyp/spark/jay eval 联动内容 诚实度声明:本轮 eval 主题净增量密度「极低」—— eval 主分类 paper_card NET-new 净增 0 件;eval 邻接/副分类净增 2 件(SafeActBench eval 副分类 + EMHO eval 主分类强邻接,已被 jay engineering-e1prep 标记为 marginal)。Oct 7 已由 AgencyBench + JIL Attack + Selection vs Extraction + LMBuild 完成 eval 密集锚定;Oct 8 eval 窗口期无颠覆性新 benchmark 范式。如实报告,不硬凑字数。


状态摘要

  • 增量条数:2 条(邻接/副分类级,未达 3-8 条目标,但来源真实)
  • 核心新增:① SafeActBench(2610.07753 · agent 主/eval 副 · HF Daily 34▲ #1 · 工具使用 Agent 证据-行动链条断裂诊断 benchmark)② EMHO(2610.08432 · eval 主分类 paper_card,但 jay engineering-e1prep 已标记为 marginal engineering 相关)
  • 澄清:本轮 eval 主分类 NET-new = 0 件;SafeActBench 属 agent 主分类,eval 强副分类;EMHO paper_card 虽为 eval 主分类,但已被 jay engineering-e1prep 判定为 marginal,不作为独立锚点升级
  • 涉及 arXiv 号:本次新增 2 个(2610.07753 · 2610.08432)+ 续用 R97 锚定锚 190-193 及其他锚定条目

〇、检查过的来源清单

来源目录 关键文件 eval 相关度
organized/knowledge evaluation.md(R97 基线 · 含锚 190 AgencyBench + 191 JIL Attack + 192 Selection vs Extraction + 193 LMBuild + 187-189 Tail-Influence/4DCodeBench/CUAWright) 极高 ⭐⭐⭐⭐⭐
inbox/tom 2026-10-07-evaluation-e1prep.md(Oct 7 E1 基线 · 含 AgencyBench + JIL Attack + Selection vs Extraction + LMBuild) 极高 ⭐⭐⭐⭐⭐
inbox/tom 2026-10-06-evaluation-e1prep.md(Oct 6 E1 基线 · 含 Tail-Influence Sampling + 4DCodeBench + CUAWright) 高 ⭐⭐⭐⭐
inbox/tom 2026-10-08-agent-rag-longcontext-radar.md(Oct 8 早 radar · 含 SafeActBench 高价值 #1) 高 ⭐⭐⭐⭐
inbox/tom 2026-10-08-rag-e1prep.md(Oct 8 早 · RAG-PIBench eval 副分类邻接) 中 ⭐⭐⭐
inbox/jay 2026-10-07-engineering-e1prep.md(Oct 7 · 含 JIL Attack + EMHO 边际相关) 高 ⭐⭐⭐⭐
inbox/jay 2026-10-08-engineering-e1prep.md(Oct 8 · EMHO marginal 判定) 高 ⭐⭐⭐⭐
inbox/spark 2026-10-08-agent-e1prep.md(Oct 8 13:30 · 含 SafeActBench 立标延革预备第 133 例 + EMHO 候选) 高 ⭐⭐⭐⭐
inbox/spark 2026-10-07-agent-e1prep.md(Oct 7 · 含 AgencyBench + RLVR Reward Hacking 协同) 高 ⭐⭐⭐⭐
inbox/flyp 2026-10-07-flyP-critical-read-AgencyBench-1M-token-agent-eval.md(Oct 7 · ⭐⭐⭐⭐ · 已在 Oct 7 E1 prep 覆盖) 已覆盖
inbox/flyp 2026-10-08-multimodal-e1prep.md(Oct 8 · multimodal 主轴 + Agent 邻接) 中 ⭐⭐⭐
organized/paper_cards 1702-2610-07753.md(SafeActBench · Oct 8 mtime · agent 主/eval 副) 极高 ⭐⭐⭐⭐⭐
organized/paper_cards 1707-2610-08432.md(EMHO · Oct 8 mtime · eval 主分类) 高 ⭐⭐⭐⭐
organized/queue work-queue.md(2026-10-08 14:00 · Top 15 无 eval 新增) 高 ⭐⭐⭐⭐

一、增量条目

增量 1:SafeActBench — 工具使用 Agent 证据-行动链条断裂诊断 benchmark(2610.07753)— agent 主/eval 副(⭐⭐⭐⭐)

来源:paper_cards/1702-2610-07753.md(Oct 8 mtime · agent 主分类 · eval 副分类)· inbox/tom/2026-10-08-agent-rag-longcontext-radar.md(Oct 8 高价值条目 #1 · HF Daily 34▲ #1)· inbox/spark/2026-10-08-agent-e1prep.md(Oct 8 · 立标延革预备第 133 例候选)· 原始来源:arXiv:2610.07753v1

URL:https://arxiv.org/abs/2610.07753

TLDR(原文摘要):SafeActBench comprises 656 cases across six operational domains and five protocols that progress from static action judgment and investigated non-action to single- and multi-action workflows, showing that failures arise not only from missing information, but also from how agents use established evidence when deciding and executing actions.

要点:

  • 核心问题:工具使用 Agent 在执行外部状态变更时,即便结果正确,也无法保证其行为有先前建立的证据支撑——"证据到行动"链条在何处断裂,是长程 Agent 评测的关键盲区
  • 方法贡献:SafeActBench——656 案例 × 6 操作域 × 5 协议;从静态动作判定 + 调查非行动 → 单一动作 + 多动作工作流
  • 关键发现:失败往往在执行前就已开始——Agent 在调查尚未完成时即停止,或在所需证据尚未建立前即行动;在 10 种模型-执行环境配置下,强大的静态动作评估可能与弱得多的交互式执行并存
  • 评测创新:首次系统化诊断"有结果的正确"与"有依据的正确"之间的差距——从"任务完成率"延伸到"证据链完整性";与 UndoBench(任务 vs 恢复解耦)形成"失败前 vs 失败后"的双向诊断
  • 与 UndoBench 的关系:UndoBench 关注"任务完成后坏掉怎么办",SafeActBench 关注"任务还没开始就坏掉"——两者共同构成 Agent 失败诊断的完整时间线
  • ⚠️ 待核实:656 案例的具体领域分布;6 操作域定义;5 协议的具体内容;静态评估与交互式执行的差距在哪些模型-环境配置下最大

与活文档 evaluation.md 现有脉络的关系: - 邻接 R97 §1.3 长程/多 Agent 评测七端点:SafeActBench 以"证据-行动"断裂诊断扩展了长程 Agent 评测的能力维度——与 R97 AgencyBench(1M-token 真实世界)、R95 DyadMem(关系记忆)、R93 OpenTumorBoard(临床协作)形成"执行+证据+关系+协作"四维评测矩阵 - 邻接 R97 §1.2 LLM-as-Judge 失效模式:SafeActBench 揭示的"静态强/交互式弱"现象与 LLM-as-Judge 的聚合层失效(SEAL ρ 高 ≠ 与人类偏好对齐)形成跨维度呼应——两者都说明"单点测量 ≠ 真实能力" - 邻接 R97 §2.1 Harness + Judge 累积:SafeActBench 的 10 种模型-执行环境配置是 harness 多样性的新证据——同一模型在不同 harness 下表现差异是该 benchmark 的核心发现 - 建议归入章节:§1.3 长程/多 Agent 评测基准(eval 副分类邻接 · SafeActBench 2610.07753 · 工具使用 Agent 证据-行动链条断裂诊断 · 656 案例 × 6 操作域 × 5 协议 · ⚠️ agent 主分类,不占 eval 锚点名额;建议作为 eval 邻接锚点纳入 §1.3)


增量 2:EMHO — 具身 Agent Harness 优化 via 经验轨迹(2610.08432)— eval 主分类/marginal(⭐⭐⭐)

来源:paper_cards/1707-2610-08432.md(Oct 8 mtime · eval 主分类 · agent 副分类)· inbox/jay/2026-10-07-engineering-e1prep.md(Oct 7 · 工程增量 6 相关)· inbox/jay/2026-10-08-engineering-e1prep.md(Oct 8 · marginal 工程相关判定)· 原始来源:arXiv:2610.08432v1

URL:https://arxiv.org/abs/2610.08432

TLDR(原文摘要):EMHO goes beyond recovering from failures and unproductive actions to reshape how the embodied agent interprets and interacts with its environment, and is evaluated on EmbodiedBench across navigation and manipulation tasks.

要点:

  • 核心问题/方法:提升具身 Agent 通常聚焦于通过训练优化底层模型,而 Agent Harness(规划、上下文、工具调用)多以工程方式搭建;EMHO 提出——Harness 能否直接在稀疏环境反馈下、依据经验轨迹自我改进?EMHO 冻结具身模型不变,通过分析执行轨迹与既有 Harness 历史对其 Harness 进行迭代修订;优化超越技能或恢复提示层面,修改 agent 的规划/上下文/工具调用架构设计
  • 评测:在 EmbodiedBench 导航和操作任务上评估
  • 定性发现:EMHO 超越从失败与无效动作中恢复,重塑了具身 Agent 对环境的解释与交互方式
  • 工程关联(来源:jay 10-7 engineering-e1prep):EMHO 与 UndoBench 互补(UndoBench = 评估/解耦;EMHO = 自演进优化);EMHO 冻结模型改 harness 的思路与 SEIS(Agent 自动构建推理引擎)形成 Agent 自优化跨层类比
  • ⚠️ 重要标注:jay 10-8 engineering-e1prep 将 EMHO 判定为"marginal 工程相关"——paper_card 虽为 eval 主分类,但 EMHO 的核心贡献是"harness 自演进方法",而非新的评测基准或指标体系;spark 10-8 agent-e1prep 将 EMHO 列为候选级(未进入主棒位增量)

与活文档 evaluation.md 现有脉络的关系: - 邻接 R97 §2.1 Harness + Judge 累积:EMHO 的"冻结模型改 harness"思路是 CUAWright 极简 harness 的方法论升级版——CUAWright 主张用极简 harness(bash 唯一接口),EMHO 主张通过经验轨迹自演进 harness——两者共同构成"harness 静态 vs harness 动态"的设计哲学对比 - 邻接 R97 §1.4 垂类高风险场景多阶段多维评测:EMHO 在 EmbodiedBench(具身 AI benchmark)上评估,与 SimuVerity(工程 Simulink)、SWE-Serve(推理工程)共同构成垂类评测方法的三种形态(仿真/工程/具身) - 建议归入章节:§2.1 Harness + Judge 累积(eval 主分类/marginal · EMHO 2610.08432 · 具身 Agent Harness 自演进方法 · ⚠️ marginal:harness 自演进方法优先于 eval 贡献;建议作为 eval 邻接锚点,不升 eval 主锚点)


二、值得警惕的矛盾或待核实说法

⚠️ 待核实 1:SafeActBench 静态评估与交互式执行的差距来源

  • 待核实项:SafeActBench 发现"在 10 种模型-执行环境配置下,强大的静态动作评估可能与弱得多的交互式执行并存"——但具体哪些模型-环境配置差距最大、差距的根因(harness 差异?任务类型差异?协议复杂度差异?)未披露
  • 潜在价值:如果静态/交互式差距可归因于特定 harness 设计选择,则 SafeActBench 可成为 harness 设计评估的新工具
  • 建议:R98 前需原文精读确认差距的分布特征
  • 来源:paper_cards/1702-2610-07753.md

⚠️ 待核实 2:EMHO 的 paper_card 分类(eval 主)与 jay marginal 判定之间的张力

  • 待核实项:paper_card 1707 将 EMHO 主分类标注为 evaluation,但 jay 10-8 engineering-e1prep 将其判定为 marginal engineering 相关——两者的分歧点在于:paper_card 按"评测对象"分类(EmbodiedBench 评测 = eval),jay 按"方法论贡献"分类(harness 自演进 = engineering)
  • 潜在价值:EMHO 实际上是一个 eval+harness 工程交叉贡献的工作,其"冻结模型改 harness"方法是 eval 方法论的创新还是 engineering 方法论的延伸,取决于 evaluation.md 对 harness 自演进是否定义为 eval 方法学范畴
  • 建议:R98 综合轮前由 jay/tom 联合确认 EMHO 的归类路径(eval 主锚 or engineering 邻接)
  • 来源:paper_cards/1707-2610-08432.md + inbox/jay/2026-10-08-engineering-e1prep.md

⚠️ 待核实 3:SafeActBench 与 UndoBench 的精确边界

  • 待核实项:SafeActBench(证据-行动断裂)与 UndoBench(任务-恢复解耦)是否互补而非重叠?两者的 6 操作域 vs 8 企业领域、5 协议 vs 36 基础+36 故障场景,是否构成联合评测框架?
  • 建议:原文精读后确认是否有联合评测价值
  • 来源:paper_cards/1702-2610-07753.md + paper_cards/1692-2610-05622.md(UndoBench)

三、本轮无显著新增声明

本轮 eval 主题在 Oct 7 已由 AgencyBench + JIL Attack + Selection vs Extraction + LMBuild 完成了 4 件密集锚定(1 主分类 benchmark + 3 邻接/副分类),形成 R97 锚点 190-193。Oct 8 eval 窗口期:

  • eval 主分类 paper_card NET-new = 0 件:EMHO(2610.08432)虽为 eval 主分类 paper_card,但 jay engineering-e1prep 判定为 marginal;SafeActBench(2610.07753)有明确 eval 副分类贡献,但 paper_card 主分类为 agent
  • eval 邻接/副分类净增 = 2 件:SafeActBench(agent 主/eval 副)+ EMHO(eval 主分类 marginal)
  • 整体落在长程 Agent 评测方法论细化和具身 harness 自演进两个子方向,无颠覆性新 benchmark 范式

无硬凑声明:本轮只找到 2 条邻接/副分类级 eval 相关增量,远低于 3-8 条目标区间——原因是 Oct 7 已完成密集锚定,Oct 8 确实为 eval 窗口低信号期。来源已如实核查,不编造增量条目充数。


四、可引用的 arXiv 号列表

arXiv 号 标题 主/邻 状态
2610.07753v1 SafeActBench: From Evidence to Action — How Tool-Using Agents Fail agent 主/eval 副 🆕 本轮 eval 副分类邻接候选(HF Daily 34▲ #1 · 证据-行动链条断裂诊断 · 656 案例 × 6 操作域 × 5 协议)
2610.08432v1 EMHO: EMbodied Agent Harness Optimization via Experience Traces eval 主分类/marginal 🆕 本轮 eval 主/marginal(harness 自演进方法 · jay marginal 判定 · ⚠️ 建议 engineering 邻接归引)
2601.11044v4 AgencyBench: Benchmarking the Frontiers of Autonomous Agents in 1M-Token Real-World Contexts eval 主/benchmark Oct 7 E1 prep 已锚定(R97 锚 190)
2610.03430 JIL Attack: 利用长度预测干扰 LLM 调度 engineering 主/eval 强邻接 Oct 7 E1 prep 已锚定(R97 锚 191)
2609.34227 When Does Selection Replace Extraction? A Pre-Registered Test of Agent Memory agent 主/eval 副 Oct 7 E1 prep 已锚定(R97 锚 192)
2610.04292 LMBuild eval 邻接候选 Oct 7 E1 prep 已锚定(R97 锚 193 · ⚠️ TLDR 截断待核实)
2609.38096 Tail-Influence Sampling for CVaR Policy Evaluation eval 主/method Oct 6 E1 prep 已锚定(R96 锚 187)
2610.03715 4DCodeBench: Benchmarking Agents on Inverse Graphics of Dynamic Scenes eval 主/benchmark Oct 6 E1 prep 已锚定(R96 锚 188)
2610.04116 CUAWright: A Minimal Unified Interface for Digital Agents agent 主/eval 副 Oct 6 E1 prep 已锚定(R96 锚 189)
2610.02304 SimuVerity: Engineering-Grade Simulink Model Generation Benchmark eval 主 R95 已锚定
2609.39071 LexReward: A Taxonomy-Driven Reward Framework for Legal Language Models eval 主 R95 已锚定
2610.03020 DyadMem: A Long-Term Memory Benchmark of How Agents Work with Users agent 主/eval 副 R95 已锚定
2610.03574 HyperBrowseComp: Multilingual Multimodal Web-Browsing Agent Evaluation multimodal 主/agent 副 R95 已锚定
2609.26777 SWE-Serve: Production-Grade Inference Engineering Benchmark llm-infra 主/eval 邻 R95 已锚定
2610.03632 World Embedding Benchmark multimodal 主/rag 副 R95 已锚定
2610.03421 CLIMB: Confidence-Guided Multimodal RAG with Complementary Evidence rag 主/multimodal 副 R95 已锚定
2610.03136 Reasoning-Language Alignment in Monolingual RAG rag 主/risk 副 R95 已锚定
2609.29769v2 JEV vs. LLMs as Rubric Judges eval 主/risk 副 flyp Oct 6 risk-e1prep 已锚定
2605.30104 SEAL: LLM-as-Meta-Judge 副分类 eval R93 已锚定
2510.11977 HAL: Holistic Agent Leaderboard 邻接 eval R93 已锚定
2606.05670 BenchAgent: Protocol-Aligned Agent Workflow Evaluation 邻接 eval R93 已锚定
2610.01428 SAGO: Generalization Is Stability eval 主 R93 已锚定
2609.00559 PhysVista: Benchmarking Physical Intelligence in VLMs eval 主 R93 已锚定
2609.32810 OpenTumorBoard: Multidisciplinary Tumor Board Discussion eval 主 R93 已锚定
2609.38137 LongHarness Bench 邻接 eval R93 已锚定

Tom · 2026-10-08 15:40 CST · evaluation · E1 预消化轮 · inbox/tom/2026-10-08-evaluation-e1prep.md