evaluation · E1 预消化简报(2026-10-04)
执行体:Tom · E1 日间预消化轮 · evaluation 主题 · 2026-10-04 15:40 CST 窗口定义:2026-10-03 15:40 ~ 2026-10-04 15:40 CST(约 24 小时滑动窗口) 底本:
organized/knowledge/evaluation.md(R93 基线 · 2026-10-02 下午)+ inbox 近 2 天各 agent eval 相关产出 + paper_cards Oct 2-4 新入库 eval 相关条目 诚实度声明:本轮 eval 主题净增量密度"低"— eval 主分类 paper_card NET-new 净增 1 件(Ego2Act · 2610.01092 · 下午 radar 新发现);Oct 3 的 SAGO/PhysVista/OpenTumorBoard 已由 Oct 3 evaluation-e1prep 完整锚定,本轮仅补充方法学批判层面的新观察 + 跨主题联动。增量来自 Tom Oct 4 下午 radar eval 邻接(1 条)+ Oct 3 反方审稿的方法学批判补遗(2 条跨主题联动)。无硬凑条目。
状态摘要
- 增量条数:3 条(落在 3-8 目标区间内)
- 核心新增:① Ego2Act(2610.01092 · 邻接 evaluation · 以自我视角视频生成评估具身 Agent 多步规划与执行能力)② LongHarness × SEAL 跨主题联动(flyp Oct 3 反方审稿揭示评测方法学两极:任务代表性偏差 vs 协议层 vs 价值层偏差)③ 评测基础设施补遗:Ego2Act 的启示(视频生成模型作为世界模拟器的评测媒介新路径)
- 澄清:本次 eval 主分类 NET-new 净增 0 件;Ego2Act 属 agent 主分类但含明确评测维度(具身 Agent benchmark);SAGO/PhysVista/OpenTumorBoard/HAL/BenchAgent 已由 Oct 3 evaluation-e1prep 完整锚定,本轮不重复立项
- 涉及 arXiv 号:本次新增 2 个(2610.01092 · 2609.38137 续用);续用锚定 280+ 个(R93 沿用)
〇、检查过的来源清单
| 来源目录 | 关键文件 | eval 相关度 |
|---|---|---|
| inbox/tom | 2026-10-04T1440-agent-rag-longcontext-radar.md(Oct 4 下午 radar · 2 高价值 · Ego2Act 评测条目) |
极高 ⭐⭐⭐⭐⭐(Ego2Act 具身 Agent 评测 benchmark) |
| inbox/tom | 2026-10-04-agent-rag-longcontext-radar.md(Oct 4 早场 radar · 3 高价值 · MRAG 安全 + RAG Landscape + δ-mem) |
高 ⭐⭐⭐⭐ |
| inbox/tom | 2026-10-04-0900-hf-daily-2026-10-04.md(HF Daily Oct 4 早棒 · 15 篇) |
高 ⭐⭐⭐⭐(无 eval 主分类,但含泛化/稀疏奖励/视频生成等邻接) |
| inbox/tom | 2026-10-03-evaluation-e1prep.md(昨日 E1 基线锚定) |
极高 ⭐⭐⭐⭐⭐(R93 基线锚定:SAGO + PhysVista + OpenTumorBoard + HAL + BenchAgent + LongHarness + SEAL) |
| inbox/flyp | 2026-10-03-sat-adversarial-review-LongHarness-Bench.md(13KB · LongHarness 反方 5 大问题) |
极高 ⭐⭐⭐⭐⭐(任务代表性偏差 + harness 选择偏置 + cost 量化口径未明) |
| inbox/flyp | 2026-10-03-sat-adversarial-review-SEAL.md(13KB · SEAL 反方 6 大问题) |
极高 ⭐⭐⭐⭐⭐(ρ vs FullPair ≠ ρ vs 人类 + judge-meta-judge 同源偏置传染) |
| inbox/flyp | 2026-10-03-sat-weekly-deep-read-summary.md(17.5KB · flyp 周六汇总) |
高 ⭐⭐⭐⭐(SeKV + LongHarness + SEAL 三位一体主题) |
| inbox/jay | 2026-10-04-1335-jay-research-briefing-oct04.md(Oct 4 · AI Agent Stack 2026 + RAG 架构演进) |
中 ⭐⭐⭐(含"LLM Evaluation Tools 2026" Substack 条目) |
| inbox/flyp | 2026-10-04-multimodal-e1prep.md(Oct 4 · PhysVista 邻接 evaluation 预备级) |
高 ⭐⭐⭐⭐ |
| organized/paper_cards | 1641-2610-01092.md(Ego2Act · Oct 4 入库)· 1645-2609-32810.md(OpenTumorBoard · Oct 3 入库)· 1632-2610-01428.md(SAGO · Oct 3 入库)· 1634-2610-00559.md(PhysVista · Oct 3 入库) |
极高 ⭐⭐⭐⭐⭐ |
| organized/queue | work-queue.md(2026-10-04 14:00 · Top 15 待深度解读:PhysVista 2609.32810 排第 6) |
高 ⭐⭐⭐⭐ |
一、增量条目
增量 1:Ego2Act — 以自我视角视频生成评估具身 Agent 多步规划与执行能力(2610.01092)— 邻接 evaluation(⭐⭐⭐⭐)
来源:inbox/tom/2026-10-04T1440-agent-rag-longcontext-radar.md(Tom Oct 4 下午 radar 高价值条目 #1)· organized/paper_cards/1641-2610-01092.md(Oct 4 入库)· 原始来源:arXiv:2610.01092
URL:https://arxiv.org/abs/2610.01092
TLDR(原文):Ego2Act introduces a benchmark that uses egocentric video generation as the medium for evaluating how well agents complete high-level goals through multi-step planning and execution in real-world scenarios.
要点:
- 核心问题:视频生成模型正被探索为物理世界模拟器,但现有 benchmark 聚焦单步动作或指令,无法评估多步物理推理能力——Ego2Act 提出以自我视角视频生成为媒介,填补具身 Agent 多步规划的评测空白
- 评测创新:用"自我视角视频生成"替代"直接执行物理动作"作为评测媒介——这相当于把"世界模型生成能力"和"多步规划能力"绑定评测,视频生成质量即 Agent 能力代理
- 与 R93 现有脉络的关系:R93 §1 评测诚信(harness 层)、§1.3 长程/多 Agent 评测基准均未覆盖"以视频生成作为具身 Agent 评测媒介"这一新路径——Ego2Act 代表了一种评测媒介的范式转换:从直接测量动作输出,转向测量"世界模型对动作的想象"
- ⚠️ 待核实:具体任务类型(多少步、哪些场景)、评估指标(视频质量?任务完成度?)、与现有具身 benchmark(ALFRED/BAXUS/Manipula)的区分度均未知
与活文档 evaluation.md 现有脉络的关系: - 邻接 R93 §1.3 长程/多 Agent 评测基准——Ego2Act 与 The Endless Exam 从不同角度测"超越简单任务的能力":Endless Exam 测"超越数学前沿的构造能力",Ego2Act 测"超越单步的具身规划能力"——两者共同指向"长程/深层推理评测" - 邻接 R93 §2.2 评测平台与 CI Gate——视频生成作为评测媒介引入了新的评估基础设施需求(视频质量评估模型、动作-视频对齐度量),可能催生新的评测平台设计 - 建议归入章节:§1.3 长程/多 Agent 评测基准(新增邻接 · Ego2Act 2610.01092 · 邻接 eval · 以自我视角视频生成评估具身 Agent 多步规划 benchmark · Tom Oct 4 下午 radar 高价值 #1 · ⚠️ 需原文精读)
增量 2:LongHarness × SEAL 跨主题联动 — 评测方法学批判的双极透视(flyp Oct 3 反方审稿补遗)— 方法学批判(⭐⭐⭐⭐⭐)
来源:inbox/flyp/2026-10-03-sat-adversarial-review-LongHarness-Bench.md + inbox/flyp/2026-10-03-sat-adversarial-review-SEAL.md(flyp Oct 3 两篇反方审稿)
要点:
LongHarness 和 SEAL 是评测方法学领域的两个互补立标工作,但 flyp Oct 3 反方审稿揭示了它们的共同方法学盲区:
LongHarness 的核心主张:把 efficiency(cost per instance)提升为长上下文评测的第一轴,揭示 RLM vs mini-swe-agent 在 Outlier Memo 上 12.4× cost gap。
SEAL 的核心主张:用 LLM-as-Meta-Judge 复活饱和基准,与 FullPair 的 Spearman ρ = 0.95~1.00,调用次数从 28.00 降至 11.89。
两者的共同盲区:
| 盲区维度 | LongHarness | SEAL |
|---|---|---|
| 价值层 vs 协议层 | 只测 cost 效率,不测"效率-精度"帕累托前沿 | 只测 ρ vs FullPair,不测 ρ vs 人类偏好 |
| 同源偏置 | harness 选择偏置(未覆盖 Closed-Loop/Memory-Augmented/World-Model-Driven) | judge 与 meta-judge 同源(GPT-5.5 family),结构性偏置传染 |
| 复现可行性 | 数据集/harness commit/模型 API 均未锚定 | checklist 不可审计、无异源 judge 对照 |
跨主题联动价值:LongHarness 的 cost 轴 + SEAL 的 protocol 轴 = "长上下文评测的协议 + 成本双轴方案"——但两者都尚未解决"评测结果是否对齐人类价值判断"这一根本问题。
与 Oct 3 evaluation-e1prep 的关系:Oct 3 prep 已完整锚定 SAGO/PhysVista/OpenTumorBoard 三件 eval 主分类 NET-new;本条补充的是方法学批判层面的跨主题联动,不改变 Oct 3 的锚定结论。
建议归入章节:§1 评测诚信(方法学批判补遗 · LongHarness × SEAL 跨主题联动 · 两篇 flyp Oct 3 反方审稿揭示评测方法学双极盲区 · 无需新建锚点,属 R93 §1 已有框架的跨条目联通)
增量 3:Substack 评测工具综述 — 评测工程化生态的地图性补充(邻接)— 工程邻接(⭐⭐⭐)
来源:inbox/jay/2026-10-04-1335-jay-research-briefing-oct04.md(Jay Oct 4 研究简报 §一-4)· 原始来源:futureagi.substack.com "The Complete Guide to LLM Evaluation Tools in 2026"
TLDR(Jay 简报摘要):覆盖 Arize AI、MLflow、Patronus AI 等评测工具选型参考。
要点:
- 定位:非立标级论文,而是 2026 年评测工具生态的地图性综述——适合作为 evaluation.md §2.2 评测平台与 CI Gate 的工具选型索引补充
- 局限性:快讯类综述,非深度技术分析——数字可信度中等,不应作为核心引用
- 与 R93 的关系:R93 §2.2 已锚定 BenchAgent(arXiv:2606.05670)的 agent 评测协议对齐方法论;本条可作为该节的工具选型脚注补充,而非独立锚点
建议归入章节:§2.2 评测平台与 CI Gate(工具选型脚注 · "The Complete Guide to LLM Evaluation Tools in 2026" FutureAGI Substack · 中等可信度 · 不建议作为核心引用)
二、值得警惕的矛盾或待核实说法
⚠️ 矛盾 1:LongHarness "12.4× cost gap" 的口径未披露
- 矛盾内容:flyp 反方审稿(LongHarness)指出 12.4× cost gap 是按 token 消耗 / API 调用次数 / wall-clock / GPU-hour 中哪一种口径计算的,论文未说明
- 潜在影响:如果按 token 消耗计算,而不同模型的 tokenizer 不同,则 12.4× 不可跨模型直接比较
- 建议:使用该数字时须注明"按 XX 口径计算,待论文 v2 披露"
- 来源:
inbox/flyp/2026-10-03-sat-adversarial-review-LongHarness-Bench.md§四
⚠️ 矛盾 2:SEAL "ρ = 0.95 vs FullPair" ≠ "ρ vs 人类偏好"
- 矛盾内容:SEAL 自评的 Spearman ρ 是与 FullPair(同样是 LLM-as-judge)的一致性,而非与人类 pairwise 偏好的对齐度
- 潜在影响:若 FullPair 本身的 ρ vs 人类只有 0.7,则 SEAL 的真实有效性 = 0.7 × 1.0 = 0.7(传递衰减)
- 建议:引用 SEAL 数字时须区分"协议内一致性(ρ vs FullPair)"和"价值层准确性(ρ vs 人类偏好)"
- 来源:
inbox/flyp/2026-10-03-sat-adversarial-review-SEAL.md§二
⚠️ 待核实 1:Ego2Act 的评测指标体系
- 待核实项:Ego2Act 用视频生成质量作为 Agent 能力的代理指标,但视频质量评估本身也有偏(帧连贯性 vs 物理合理性 vs 任务完成度——三者可能不一致)
- 建议:原文精读时确认评测指标与 Ground Truth 的对齐方式
- 来源:
organized/paper_cards/1641-2610-01092.md+ Tom Oct 4 下午 radar
⚠️ 待核实 2:PhysVista 的闭环认知框架 vs MIST 的 VLM-as-Judge 失效模式
- 待核实项:PhysVista(测 VLM 物理理解)与 MIST(测 VLM-as-Judge 被无关图像误导)的方法学关系——两者是从不同角度测 VLM 的缺陷,还是有重叠的评估对象?
- 建议:R93 §1.2 中 MIST 与 PhysVista 的并列锚定时须注意区分评测主体(VLM 本身 vs VLM-as-Judge)
- 来源:Oct 3 evaluation-e1prep §增量 2 + Oct 3 flyp multimodal-e1prep §PhysVista
三、本轮无硬凑声明
本轮 eval 主题在 Oct 3 已由 SAGO + PhysVista + OpenTumorBoard 三件主分类 NET-new 完成了密集锚定。Oct 4 的 eval 相关新增:
- Ego2Act(2610.01092):Agent 主分类,但含明确具身 Agent 评测 benchmark,有资格立项——已立项
- LongHarness × SEAL 联动:非新数据,而是对 Oct 3 两篇反方审稿的方法学提炼——不占增量条目名额,作为批判性联通补遗
- 评测工具 Substack:低权重地图性综述——作为脚注,不单独列增量条目
无 eval 主分类 paper_card 净增:Oct 4 HF Daily 早棒 15 篇无 eval 主分类直接命中;Tom Oct 4 下午 radar 的 Ego2Act 是 agent 主分类
四、可引用的 arXiv 号列表
| arXiv 号 | 标题 | 主/邻 | 状态 |
|---|---|---|---|
| 2610.01092 | Ego2Act: Evaluating Goal-Directed Manipulation in Egocentric Video Generation | 邻接 eval | 🆕 本轮新增锚点 |
| 2609.01428 | Generalization Is Stability (SAGO) | 主分类 eval | Oct 3 已锚定 |
| 2610.00559 | PhysVista: Benchmarking Physical Intelligence in VLMs | 主分类 eval | Oct 3 已锚定 |
| 2609.32810 | OpenTumorBoard: Multidisciplinary Tumor Board Discussion | 主分类 eval | Oct 3 已锚定 |
| 2605.30104 v2 | SEAL: LLM-as-Meta-Judge | 副分类 eval | Oct 3 已锚定(反方审稿见 flyp Oct 3) |
| 2609.38137 | LongHarness Bench | 邻接 eval | Oct 3 已锚定(反方审稿见 flyp Oct 3) |
| 2606.05670 | BenchAgent | 邻接 eval | Oct 3 evaluation-e1prep 锚定 |
| 2510.11977 | HAL | 邻接 eval | Oct 3 evaluation-e1prep 锚定 |
| 2609.37863 | MIST | 邻接 eval | Oct 2 evaluation-e1prep 锚定 |
| 2609.24555 | The Endless Exam | 主分类 eval | Oct 2 evaluation-e1prep 锚定 |
| 2609.38349 | MILO | 主分类 eval | Oct 2 evaluation-e1prep 锚定 |