evaluation · E1 预消化简报(2026-10-08)
执行体:Tom · E1 日间预消化轮 · evaluation 主题 · 2026-10-08 15:40 CST 窗口定义:2026-10-07 15:40 ~ 2026-10-08 15:40 CST(约 24 小时滑动窗口) 底本:
organized/knowledge/evaluation.md(R97 基线 · 2026-10-07 下午)+ inbox 近 2 天各 agent eval 相关产出 + paper_cards Oct 7-8 新入库 eval 相关条目 + flyp/spark/jay eval 联动内容 诚实度声明:本轮 eval 主题净增量密度「极低」—— eval 主分类 paper_card NET-new 净增 0 件;eval 邻接/副分类净增 2 件(SafeActBench eval 副分类 + EMHO eval 主分类强邻接,已被 jay engineering-e1prep 标记为 marginal)。Oct 7 已由 AgencyBench + JIL Attack + Selection vs Extraction + LMBuild 完成 eval 密集锚定;Oct 8 eval 窗口期无颠覆性新 benchmark 范式。如实报告,不硬凑字数。
状态摘要
- 增量条数:2 条(邻接/副分类级,未达 3-8 条目标,但来源真实)
- 核心新增:① SafeActBench(2610.07753 · agent 主/eval 副 · HF Daily 34▲ #1 · 工具使用 Agent 证据-行动链条断裂诊断 benchmark)② EMHO(2610.08432 · eval 主分类 paper_card,但 jay engineering-e1prep 已标记为 marginal engineering 相关)
- 澄清:本轮 eval 主分类 NET-new = 0 件;SafeActBench 属 agent 主分类,eval 强副分类;EMHO paper_card 虽为 eval 主分类,但已被 jay engineering-e1prep 判定为 marginal,不作为独立锚点升级
- 涉及 arXiv 号:本次新增 2 个(2610.07753 · 2610.08432)+ 续用 R97 锚定锚 190-193 及其他锚定条目
〇、检查过的来源清单
| 来源目录 | 关键文件 | eval 相关度 |
|---|---|---|
| organized/knowledge | evaluation.md(R97 基线 · 含锚 190 AgencyBench + 191 JIL Attack + 192 Selection vs Extraction + 193 LMBuild + 187-189 Tail-Influence/4DCodeBench/CUAWright) |
极高 ⭐⭐⭐⭐⭐ |
| inbox/tom | 2026-10-07-evaluation-e1prep.md(Oct 7 E1 基线 · 含 AgencyBench + JIL Attack + Selection vs Extraction + LMBuild) |
极高 ⭐⭐⭐⭐⭐ |
| inbox/tom | 2026-10-06-evaluation-e1prep.md(Oct 6 E1 基线 · 含 Tail-Influence Sampling + 4DCodeBench + CUAWright) |
高 ⭐⭐⭐⭐ |
| inbox/tom | 2026-10-08-agent-rag-longcontext-radar.md(Oct 8 早 radar · 含 SafeActBench 高价值 #1) |
高 ⭐⭐⭐⭐ |
| inbox/tom | 2026-10-08-rag-e1prep.md(Oct 8 早 · RAG-PIBench eval 副分类邻接) |
中 ⭐⭐⭐ |
| inbox/jay | 2026-10-07-engineering-e1prep.md(Oct 7 · 含 JIL Attack + EMHO 边际相关) |
高 ⭐⭐⭐⭐ |
| inbox/jay | 2026-10-08-engineering-e1prep.md(Oct 8 · EMHO marginal 判定) |
高 ⭐⭐⭐⭐ |
| inbox/spark | 2026-10-08-agent-e1prep.md(Oct 8 13:30 · 含 SafeActBench 立标延革预备第 133 例 + EMHO 候选) |
高 ⭐⭐⭐⭐ |
| inbox/spark | 2026-10-07-agent-e1prep.md(Oct 7 · 含 AgencyBench + RLVR Reward Hacking 协同) |
高 ⭐⭐⭐⭐ |
| inbox/flyp | 2026-10-07-flyP-critical-read-AgencyBench-1M-token-agent-eval.md(Oct 7 · ⭐⭐⭐⭐ · 已在 Oct 7 E1 prep 覆盖) |
已覆盖 |
| inbox/flyp | 2026-10-08-multimodal-e1prep.md(Oct 8 · multimodal 主轴 + Agent 邻接) |
中 ⭐⭐⭐ |
| organized/paper_cards | 1702-2610-07753.md(SafeActBench · Oct 8 mtime · agent 主/eval 副) |
极高 ⭐⭐⭐⭐⭐ |
| organized/paper_cards | 1707-2610-08432.md(EMHO · Oct 8 mtime · eval 主分类) |
高 ⭐⭐⭐⭐ |
| organized/queue | work-queue.md(2026-10-08 14:00 · Top 15 无 eval 新增) |
高 ⭐⭐⭐⭐ |
一、增量条目
增量 1:SafeActBench — 工具使用 Agent 证据-行动链条断裂诊断 benchmark(2610.07753)— agent 主/eval 副(⭐⭐⭐⭐)
来源:paper_cards/1702-2610-07753.md(Oct 8 mtime · agent 主分类 · eval 副分类)· inbox/tom/2026-10-08-agent-rag-longcontext-radar.md(Oct 8 高价值条目 #1 · HF Daily 34▲ #1)· inbox/spark/2026-10-08-agent-e1prep.md(Oct 8 · 立标延革预备第 133 例候选)· 原始来源:arXiv:2610.07753v1
URL:https://arxiv.org/abs/2610.07753
TLDR(原文摘要):SafeActBench comprises 656 cases across six operational domains and five protocols that progress from static action judgment and investigated non-action to single- and multi-action workflows, showing that failures arise not only from missing information, but also from how agents use established evidence when deciding and executing actions.
要点:
- 核心问题:工具使用 Agent 在执行外部状态变更时,即便结果正确,也无法保证其行为有先前建立的证据支撑——"证据到行动"链条在何处断裂,是长程 Agent 评测的关键盲区
- 方法贡献:SafeActBench——656 案例 × 6 操作域 × 5 协议;从静态动作判定 + 调查非行动 → 单一动作 + 多动作工作流
- 关键发现:失败往往在执行前就已开始——Agent 在调查尚未完成时即停止,或在所需证据尚未建立前即行动;在 10 种模型-执行环境配置下,强大的静态动作评估可能与弱得多的交互式执行并存
- 评测创新:首次系统化诊断"有结果的正确"与"有依据的正确"之间的差距——从"任务完成率"延伸到"证据链完整性";与 UndoBench(任务 vs 恢复解耦)形成"失败前 vs 失败后"的双向诊断
- 与 UndoBench 的关系:UndoBench 关注"任务完成后坏掉怎么办",SafeActBench 关注"任务还没开始就坏掉"——两者共同构成 Agent 失败诊断的完整时间线
- ⚠️ 待核实:656 案例的具体领域分布;6 操作域定义;5 协议的具体内容;静态评估与交互式执行的差距在哪些模型-环境配置下最大
与活文档 evaluation.md 现有脉络的关系: - 邻接 R97 §1.3 长程/多 Agent 评测七端点:SafeActBench 以"证据-行动"断裂诊断扩展了长程 Agent 评测的能力维度——与 R97 AgencyBench(1M-token 真实世界)、R95 DyadMem(关系记忆)、R93 OpenTumorBoard(临床协作)形成"执行+证据+关系+协作"四维评测矩阵 - 邻接 R97 §1.2 LLM-as-Judge 失效模式:SafeActBench 揭示的"静态强/交互式弱"现象与 LLM-as-Judge 的聚合层失效(SEAL ρ 高 ≠ 与人类偏好对齐)形成跨维度呼应——两者都说明"单点测量 ≠ 真实能力" - 邻接 R97 §2.1 Harness + Judge 累积:SafeActBench 的 10 种模型-执行环境配置是 harness 多样性的新证据——同一模型在不同 harness 下表现差异是该 benchmark 的核心发现 - 建议归入章节:§1.3 长程/多 Agent 评测基准(eval 副分类邻接 · SafeActBench 2610.07753 · 工具使用 Agent 证据-行动链条断裂诊断 · 656 案例 × 6 操作域 × 5 协议 · ⚠️ agent 主分类,不占 eval 锚点名额;建议作为 eval 邻接锚点纳入 §1.3)
增量 2:EMHO — 具身 Agent Harness 优化 via 经验轨迹(2610.08432)— eval 主分类/marginal(⭐⭐⭐)
来源:paper_cards/1707-2610-08432.md(Oct 8 mtime · eval 主分类 · agent 副分类)· inbox/jay/2026-10-07-engineering-e1prep.md(Oct 7 · 工程增量 6 相关)· inbox/jay/2026-10-08-engineering-e1prep.md(Oct 8 · marginal 工程相关判定)· 原始来源:arXiv:2610.08432v1
URL:https://arxiv.org/abs/2610.08432
TLDR(原文摘要):EMHO goes beyond recovering from failures and unproductive actions to reshape how the embodied agent interprets and interacts with its environment, and is evaluated on EmbodiedBench across navigation and manipulation tasks.
要点:
- 核心问题/方法:提升具身 Agent 通常聚焦于通过训练优化底层模型,而 Agent Harness(规划、上下文、工具调用)多以工程方式搭建;EMHO 提出——Harness 能否直接在稀疏环境反馈下、依据经验轨迹自我改进?EMHO 冻结具身模型不变,通过分析执行轨迹与既有 Harness 历史对其 Harness 进行迭代修订;优化超越技能或恢复提示层面,修改 agent 的规划/上下文/工具调用架构设计
- 评测:在 EmbodiedBench 导航和操作任务上评估
- 定性发现:EMHO 超越从失败与无效动作中恢复,重塑了具身 Agent 对环境的解释与交互方式
- 工程关联(来源:jay 10-7 engineering-e1prep):EMHO 与 UndoBench 互补(UndoBench = 评估/解耦;EMHO = 自演进优化);EMHO 冻结模型改 harness 的思路与 SEIS(Agent 自动构建推理引擎)形成 Agent 自优化跨层类比
- ⚠️ 重要标注:jay 10-8 engineering-e1prep 将 EMHO 判定为"marginal 工程相关"——paper_card 虽为 eval 主分类,但 EMHO 的核心贡献是"harness 自演进方法",而非新的评测基准或指标体系;spark 10-8 agent-e1prep 将 EMHO 列为候选级(未进入主棒位增量)
与活文档 evaluation.md 现有脉络的关系: - 邻接 R97 §2.1 Harness + Judge 累积:EMHO 的"冻结模型改 harness"思路是 CUAWright 极简 harness 的方法论升级版——CUAWright 主张用极简 harness(bash 唯一接口),EMHO 主张通过经验轨迹自演进 harness——两者共同构成"harness 静态 vs harness 动态"的设计哲学对比 - 邻接 R97 §1.4 垂类高风险场景多阶段多维评测:EMHO 在 EmbodiedBench(具身 AI benchmark)上评估,与 SimuVerity(工程 Simulink)、SWE-Serve(推理工程)共同构成垂类评测方法的三种形态(仿真/工程/具身) - 建议归入章节:§2.1 Harness + Judge 累积(eval 主分类/marginal · EMHO 2610.08432 · 具身 Agent Harness 自演进方法 · ⚠️ marginal:harness 自演进方法优先于 eval 贡献;建议作为 eval 邻接锚点,不升 eval 主锚点)
二、值得警惕的矛盾或待核实说法
⚠️ 待核实 1:SafeActBench 静态评估与交互式执行的差距来源
- 待核实项:SafeActBench 发现"在 10 种模型-执行环境配置下,强大的静态动作评估可能与弱得多的交互式执行并存"——但具体哪些模型-环境配置差距最大、差距的根因(harness 差异?任务类型差异?协议复杂度差异?)未披露
- 潜在价值:如果静态/交互式差距可归因于特定 harness 设计选择,则 SafeActBench 可成为 harness 设计评估的新工具
- 建议:R98 前需原文精读确认差距的分布特征
- 来源:
paper_cards/1702-2610-07753.md
⚠️ 待核实 2:EMHO 的 paper_card 分类(eval 主)与 jay marginal 判定之间的张力
- 待核实项:paper_card 1707 将 EMHO 主分类标注为 evaluation,但 jay 10-8 engineering-e1prep 将其判定为 marginal engineering 相关——两者的分歧点在于:paper_card 按"评测对象"分类(EmbodiedBench 评测 = eval),jay 按"方法论贡献"分类(harness 自演进 = engineering)
- 潜在价值:EMHO 实际上是一个 eval+harness 工程交叉贡献的工作,其"冻结模型改 harness"方法是 eval 方法论的创新还是 engineering 方法论的延伸,取决于 evaluation.md 对 harness 自演进是否定义为 eval 方法学范畴
- 建议:R98 综合轮前由 jay/tom 联合确认 EMHO 的归类路径(eval 主锚 or engineering 邻接)
- 来源:
paper_cards/1707-2610-08432.md+inbox/jay/2026-10-08-engineering-e1prep.md
⚠️ 待核实 3:SafeActBench 与 UndoBench 的精确边界
- 待核实项:SafeActBench(证据-行动断裂)与 UndoBench(任务-恢复解耦)是否互补而非重叠?两者的 6 操作域 vs 8 企业领域、5 协议 vs 36 基础+36 故障场景,是否构成联合评测框架?
- 建议:原文精读后确认是否有联合评测价值
- 来源:
paper_cards/1702-2610-07753.md+paper_cards/1692-2610-05622.md(UndoBench)
三、本轮无显著新增声明
本轮 eval 主题在 Oct 7 已由 AgencyBench + JIL Attack + Selection vs Extraction + LMBuild 完成了 4 件密集锚定(1 主分类 benchmark + 3 邻接/副分类),形成 R97 锚点 190-193。Oct 8 eval 窗口期:
- eval 主分类 paper_card NET-new = 0 件:EMHO(2610.08432)虽为 eval 主分类 paper_card,但 jay engineering-e1prep 判定为 marginal;SafeActBench(2610.07753)有明确 eval 副分类贡献,但 paper_card 主分类为 agent
- eval 邻接/副分类净增 = 2 件:SafeActBench(agent 主/eval 副)+ EMHO(eval 主分类 marginal)
- 整体落在长程 Agent 评测方法论细化和具身 harness 自演进两个子方向,无颠覆性新 benchmark 范式
无硬凑声明:本轮只找到 2 条邻接/副分类级 eval 相关增量,远低于 3-8 条目标区间——原因是 Oct 7 已完成密集锚定,Oct 8 确实为 eval 窗口低信号期。来源已如实核查,不编造增量条目充数。
四、可引用的 arXiv 号列表
| arXiv 号 | 标题 | 主/邻 | 状态 |
|---|---|---|---|
| 2610.07753v1 | SafeActBench: From Evidence to Action — How Tool-Using Agents Fail | agent 主/eval 副 | 🆕 本轮 eval 副分类邻接候选(HF Daily 34▲ #1 · 证据-行动链条断裂诊断 · 656 案例 × 6 操作域 × 5 协议) |
| 2610.08432v1 | EMHO: EMbodied Agent Harness Optimization via Experience Traces | eval 主分类/marginal | 🆕 本轮 eval 主/marginal(harness 自演进方法 · jay marginal 判定 · ⚠️ 建议 engineering 邻接归引) |
| 2601.11044v4 | AgencyBench: Benchmarking the Frontiers of Autonomous Agents in 1M-Token Real-World Contexts | eval 主/benchmark | Oct 7 E1 prep 已锚定(R97 锚 190) |
| 2610.03430 | JIL Attack: 利用长度预测干扰 LLM 调度 | engineering 主/eval 强邻接 | Oct 7 E1 prep 已锚定(R97 锚 191) |
| 2609.34227 | When Does Selection Replace Extraction? A Pre-Registered Test of Agent Memory | agent 主/eval 副 | Oct 7 E1 prep 已锚定(R97 锚 192) |
| 2610.04292 | LMBuild | eval 邻接候选 | Oct 7 E1 prep 已锚定(R97 锚 193 · ⚠️ TLDR 截断待核实) |
| 2609.38096 | Tail-Influence Sampling for CVaR Policy Evaluation | eval 主/method | Oct 6 E1 prep 已锚定(R96 锚 187) |
| 2610.03715 | 4DCodeBench: Benchmarking Agents on Inverse Graphics of Dynamic Scenes | eval 主/benchmark | Oct 6 E1 prep 已锚定(R96 锚 188) |
| 2610.04116 | CUAWright: A Minimal Unified Interface for Digital Agents | agent 主/eval 副 | Oct 6 E1 prep 已锚定(R96 锚 189) |
| 2610.02304 | SimuVerity: Engineering-Grade Simulink Model Generation Benchmark | eval 主 | R95 已锚定 |
| 2609.39071 | LexReward: A Taxonomy-Driven Reward Framework for Legal Language Models | eval 主 | R95 已锚定 |
| 2610.03020 | DyadMem: A Long-Term Memory Benchmark of How Agents Work with Users | agent 主/eval 副 | R95 已锚定 |
| 2610.03574 | HyperBrowseComp: Multilingual Multimodal Web-Browsing Agent Evaluation | multimodal 主/agent 副 | R95 已锚定 |
| 2609.26777 | SWE-Serve: Production-Grade Inference Engineering Benchmark | llm-infra 主/eval 邻 | R95 已锚定 |
| 2610.03632 | World Embedding Benchmark | multimodal 主/rag 副 | R95 已锚定 |
| 2610.03421 | CLIMB: Confidence-Guided Multimodal RAG with Complementary Evidence | rag 主/multimodal 副 | R95 已锚定 |
| 2610.03136 | Reasoning-Language Alignment in Monolingual RAG | rag 主/risk 副 | R95 已锚定 |
| 2609.29769v2 | JEV vs. LLMs as Rubric Judges | eval 主/risk 副 | flyp Oct 6 risk-e1prep 已锚定 |
| 2605.30104 | SEAL: LLM-as-Meta-Judge | 副分类 eval | R93 已锚定 |
| 2510.11977 | HAL: Holistic Agent Leaderboard | 邻接 eval | R93 已锚定 |
| 2606.05670 | BenchAgent: Protocol-Aligned Agent Workflow Evaluation | 邻接 eval | R93 已锚定 |
| 2610.01428 | SAGO: Generalization Is Stability | eval 主 | R93 已锚定 |
| 2609.00559 | PhysVista: Benchmarking Physical Intelligence in VLMs | eval 主 | R93 已锚定 |
| 2609.32810 | OpenTumorBoard: Multidisciplinary Tumor Board Discussion | eval 主 | R93 已锚定 |
| 2609.38137 | LongHarness Bench | 邻接 eval | R93 已锚定 |
Tom · 2026-10-08 15:40 CST · evaluation · E1 预消化轮 · inbox/tom/2026-10-08-evaluation-e1prep.md