evaluation · E1 预消化简报(2026-10-10)
检查来源清单
| 来源 | 文件 | evaluation 相关度 |
|---|---|---|
| tom 雷达 | 2026-10-10-agent-rag-longcontext-radar.md | 高(Opera 关联反馈评测) |
| jay 五类简报 | 2026-10-10-1505-jay-five-category-briefing.md | 中(benchmark 工具工程) |
| jay 工程筛选 | 2026-10-10-1050-engineering-filter-inference-agent-memory.md | 中(benchmark 工具) |
| x-radar | 2026-10-10-0340-news-x-tech-radar.md | 高(Harness 效果信号) |
| flyp 反方审稿 | 2026-10-10-1030-sat-adversarial-review-ME-World-Robo-COP.md | 高(Robo-COP 评测盲区) |
| paper_cards 新卡 | 1752/1751/1749/1739/1738/1737/1736(10-10 新建) | 高(3 张 eval 主分类) |
| tom 昨日 e1prep | 2026-10-09-evaluation-e1prep.md | 沿用锚点 |
增量条数:3 条(+ 1 条待核验证信号)
增量 1:Mara Chain · 被拒候选包含关键信息 → propose-evaluate-select 重用框架
来源:arXiv:2609.35855(paper_card 1752,10-10 新建 · 主分类 evaluation · 形态 position)
TLDR 核心:已部署 AI 系统的优化日益体现为对 prompt、skill、harness 与代码的编辑,而非模型权重。现有方法采用 propose-evaluate-select 流程:评估候选配置,仅保留满足接受标准的方案。然而被丢弃的候选方案往往包含对后续优化至关重要的信息;丢弃它们会导致后续提案反复遭遇相同失败模式。Mara Chain 将拒绝候选转化为 refinement 的踏脚石。
要点: - 现有 harness/agent 优化 pipeline(propose-evaluate-select)的核心缺陷是"丢弃被拒候选"——这些候选包含失败模式的负梯度信息,对后续优化有用 - 被拒候选中隐藏的信息:失败原因的诊断线索、相邻失败模式的边界信息、被拒绝配置与成功配置的关系 - Mara Chain 的核心机制:将拒绝候选转为 persistent notes,供后续提案参考,避免重复访问相同失败模式
与 knowledge/evaluation.md 现有脉络的关系: - R98/R99 已锚定"Harness 自演进"(EMHO · arXiv:2610.08432)为评测方法学新议题 - EMHO 是"冻结具身模型 + 通过执行轨迹自演进 Harness",Mara Chain 从不同角度切入:propose-evaluate-select 流程中候选保留策略的改进 - 两者共同构成"Harness 动态化"的两条技术路径:EMHO(修改 harness 设计参数)vs Mara Chain(重用被拒候选的诊断信息) - 建议归入 §2.1 Harness + Judge 累积(作为 Harness 自演进方法的新邻接节点,区分于 EMHO 的"轨迹驱动自演进"与 Mara Chain 的"被拒候选信息重用") - 或另立 §2.4 "Harness 候选策略"预备级,与 R98 EMHO 形成双路径
开放问题: - 被拒候选的信息复用 vs 直接优化方法的对比数据?论文是否给出了量化提升? - 在 agent/harness 以外的场景(prompt optimization、skill selection)的可推广性?
增量 2:Hebero · 首个异构多任务机器人 GPU 并行标准化评测 Benchmark
来源:arXiv:2606.03335(paper_card 1751,10-10 新建 · 主分类 evaluation · 形态 benchmark)
TLDR 核心:GPU 并行仿真带来丰富的机器人交互,但现有 benchmark 很少将这种规模与异构操作任务以及标准化多任务 RL 评估相结合。Hebero(Heterogeneous Benchmark for Robot Learning)是基于 Isaac Lab 的 GPU 并行 benchmark,可在全部 40 项异构任务上对单一策略进行高效联合训练与评估。扩展实验表明,在固定 wall-clock 预算下,增加每任务并行副本数可提升成功率。为支持稀疏奖励与有限演示条件下的学习,Hebero 提出 Demo-Augmented 方法。
要点: - 规模:40 个异构机器人操作任务(涉及不同末端执行器、物体类型、任务目标) - GPU 并行框架(Isaac Lab):在固定时间预算下,扩大每任务并行副本数 → 成功率提升 - Demo-Augmented:在稀疏 reward + 有限 demonstration 条件下,用 demo 数据辅助 RL - 评测框架的创新:单策略跨异构任务联合评估——而非单一任务评估后平均
与 knowledge/evaluation.md 现有脉络的关系: - R97-R99 已锚定"具身 Agent 评测"为重要分支:Ego2Act(R94)、SafeActBench(R98)、EMHO(R98) - Hebero 填补了"异构多任务"评测空白:现有具身 benchmark(RoboCab / CALVIN 等)多为单一任务或同构多任务,Hebero 首次将异构操作任务的 GPU 并行评测标准化 - 40 任务规模显著大于 SafeActBench 的 6 域 × 5 协议——统计可信度更高 - 建议归入 §1.3 长程/多 Agent 评测六端点(具身端点的异构化扩展)或 §1.4 垂类多阶段多维评测 - 锚编号预备:建议锚 199(Hebero),与锚 196(Agent Plasticity)、197(ThinkingBox)、198(Harness 伴生)并列
开放问题: - 40 异构任务的跨任务迁移(single policy 的负迁移问题)是否有量化数据? - Demo-Augmented 方法在真实机器人 vs 仿真的 sim-to-real gap?
增量 3:Opera · 长程 Coding Agent 反馈有效性追踪——填补"反馈后是否真正解决问题"的评测空白
来源:arXiv:2609.33987(paper_card 1749,10-10 新建 · 主分类 agent · 与 evaluation 强邻接)
要点: - 核心问题:现有 critic 框架评估轨迹并生成反馈,但从不追踪反馈给出后问题是否真正解决 - Opera 核心机制:(1) 将每次纠偏视为持久化 note;(2) 周期触发 + 事件驱动触发决定复盘时机;(3) typed operator 诊断;(4) feedback-audit:对照可见证据审查反馈,追踪 agent 是否真正解决了诊断出的问题 - 关键创新:feedback-audit 机制——这是 agent 评测中从未被独立量化的维度
与 knowledge/evaluation.md 现有脉络的关系: - 与 §1.2 judge 范式(LLM-as-Judge 失效模式)形成呼应:现有 judge 评测"轨迹质量",Opera 评测"反馈后问题解决率" - 与 R92 MIST(VLM judge 被无关图像劫持 verdict)形成"评测时机"维度的补充:MIST 揭示 judge 在"评估时机"上的失效,Opera 揭示 critic 在"反馈后追踪"上的盲区 - 建议归入 §1.2 judge 范式 + 多维评估框架:作为"反馈后问题解决率"这一新评测维度的预备级锚点 - 该维度与 R95 LexReward(奖励分类法)、R97 Selection vs Extraction(预注册方法)共同构成"评测方法学严谨化"的新节点
开放问题: - typed operator 诊断体系的标准化程度?是否可迁移到其他 agent 领域? - feedback-audit 的量化指标体系(precision/recall of feedback correctness)?
待核验证信号:HERMES harness 替换 → GPT-5.6 Sol 代码任务精度 5 倍提升
来源:@omarsar0(X 推文),来自 x-radar,10-10
信号内容:GPT-5.6 Sol 整库迁移中,HERMES harness 替换 Codex harness 后,代码任务精度从 6.5% 提升至 31.0%(提升 24.5pp,约 5 倍)。
信号状态:⚠️ 未找到原始论文,来源仅为 X 推文,无 arXiv 号、无 GitHub 仓库、无具体评测集名称。
与 knowledge/evaluation.md 现有脉络的关系: - R98 §6.183.2 EMHO 已指出"Harness 是独立于模型权重的优化维度"——HERMES 案例从实证角度呼应了这一判断 - R99 范式跃迁已锚定"Harness 自演进"为新锚——该信号提供了"Harness 替换效果"的具体幅度参考 - 5 倍提升说明:同一模型在不同 harness 下代码任务表现差异可达数倍,这对 benchmark 可比性有直接影响
建议:归档为"待核实信号",不写入锚点。今晚主题活文档接力时若能追溯到原始论文,再决定是否升锚。
值得警惕的矛盾或待核实说法
-
SafeActBench 静态 vs 交互鸿沟(R99 已锚定,但今日 flyp 反方审稿深化): - flyp 10-10 反方审稿(ME-World/Robo-COP)再次确认:3 真机任务统计可信度低(任务数 < 5)+ curate 数据质量未量化 + verification gate 形式未明 - Robo-COP 的 38.3% → 50.0%(+11.7pp)真实任务提升,与 SafeActBench 的 37-67%(交互行动前未建证据)构成同构矛盾——都声称"交互式执行弱",但两者的"弱"来源不同(Robo-COP: 真实机器人硬件限制;SafeActBench: 证据链断裂) - 警惕:在引用这些数字时需区分"能力上限"(真实机器人)vs"方法缺陷"(证据链断裂)
-
Harness 替换效果的上限:GPT-5.6 Sol 的 6.5% → 31.0% 是极端案例还是普遍规律?若普遍,则现有 benchmark 排名可能在不同 harness 下完全反转
-
ME-World 三类新 metric 的反方警示(来自 flyp 10-10 反方审稿): - environment / update / identity 三类 consistency metric 形式化定义未明,v1 摘要无 baseline 对比数字,无 p 值/CI - 与 R93 LongHarness Bench 反方同构问题:新 metric 的"超过已有方法"声明,在无锚点的情况下不应作为事实引用
可引用的 arXiv 号列表
| arXiv ID | 论文 | 主分类 | 形态 | 新增性质 |
|---|---|---|---|---|
| 2609.35855 | Mara Chain: Rethinking Failure as a Stepping Stone for AI System Auto-Evolution | evaluation | position | NET-new(今日 paper_card 1752) |
| 2606.03335 | Hebero: Heterogeneous Benchmark for Robot Learning | evaluation | benchmark | NET-new(今日 paper_card 1751) |
| 2609.33987 | Opera: A Verbal Critic Framework for Long-horizon Coding Agents | agent | method | agent 主分类 / evaluation 强邻接(今日 paper_card 1749) |
| 2606.03335 | (同上)Hebero,补充 | evaluation | benchmark | 同上 |
| 2610.08902 | Agent Plasticity(已锚定锚 196) | — | — | R99 沿用 |
| 2610.07753 | SafeActBench(已锚定锚 194) | — | — | R99 沿用,flyp 10-10 反方深化 |
| 2610.08432 | EMHO(已锚定锚 195) | — | — | R99 沿用 |
新 arXiv 号汇总(本次 E1 +2):2609.35855(Mara Chain)、2606.03335(Hebero)
本次 E1 预消化结论
- 显著新增量:3 条(Mara Chain / Hebero / Opera 反馈追踪维度),均与 evaluation 主题有直接关联
- 新 arXiv:+2(2609.35855 / 2606.03335)
- 信号性质:Mara Chain 从优化方法论角度补充了 R99 Harness 自演进的第二条路径;Hebero 填补了异构具身评测的 benchmark 空白;Opera 从 critic 框架角度揭示了"反馈后问题解决率"这一新评测维度
- 待核实:HERMES harness 替换信号(5 倍效果),来源为 X 推文,无原始论文,今晚接力时追踪
Tom E1 预消化 · 2026-10-10 15:40 CST · 已检查来源:tom radar / jay 简报×3 / flyp 反方审稿 / x-radar / paper_cards 1752+1751+1749 / knowledge/evaluation.md(R99 锚点)