date: 2026-10-11 round: R2 arxiv_link: https://arxiv.org/abs/2610.10409 video_kb_script_path: /shared/video-kb/scripts/tom/2026-10-11_R2_robotworld-harness-embodied_short-video-script.md


1. 标题与观众

  • 标题:评测不该绑死一个仿真器
  • 目标观众:AI Agent / 多模态 Agent 工程师 · 平台 / 评测基础设施架构师 · 具身 / Embodied AI 研究者 · Eval-Driven Development 实践者 · 主动防御 / 红队研究员
  • 一句话核心观点:把评测从「绑死一个仿真器」升级为「绑定一组 task profile + Harness 抽象」,RobotWorld 用统一 Harness 跨 20 个源项目集成 84 项任务 + observation-only 接口 + 不可见检查器,让多模态 agent 在 5 类本体上被公平测一次。

3. 45-90 秒口播稿

做机器人评测的人都踩过同一个坑:你的 agent 强不强,完全取决于你绑了哪个仿真器。Isaac Sim / MuJoCo / RoboCasa,换一台就掉点;绑定单 embodiment,跨本体迁移就没有信号。

arXiv 2610.10409 给出了一个新范式:RobotWorld。它不再绑死一个仿真器,而是绑死一组 task profile 和一个统一的 Harness 抽象。一个 Harness 跨 20 个源项目集成 84 项任务,manipulation、mobile manipulation、locomotion、driving、aerial control 五类本体共用同一套协议。

关键设计:观测里禁止直接发布动作,environment tool 包给 agent;成功检查器对 agent 不可见,避免 reward hacking。这套防作弊接口,叫 observation-only。

数字上看,Astra 强在空间和受限接触目标,Opus 5.5 强在连续平衡和限时交互目标。但项目方承认实验没控制策略相同,差异可能源自速度、决策粒度或工具调用模式中的任意一项 —— 不要直接当绝对能力读。

更值得看的是系统性失败:agent 到达指令姿态,也会丢失与任务相关的物体状态;无法纠正无效动作,恢复太迟,把未完成误认为已完成。四步级联失败,比单纯看 19% 成功率更有诊断价值。

实操:做多模态 agent 评测,先在 Harness 抽象层把 embodiment / observation / checker 解耦,每任务一权,样本数要么扩、要么上 bootstrap,别让单 episode 决定工程结论。

4. 镜头分镜

  1. 开场 (8s):评测员被四套仿真器线缠住,中间统一的 Harness 抽象浮起;屏幕文字「评测不该绑死一个仿真器」;画面元素 = 多仿真器图标 + 线团 + Harness 框;运动方式 = 线团挣脱收束到中央 Harness,Harness 发出蓝绿色辉光。
  2. Harness 抽象演示 (10s):Harness 框拆成 3 层 = embodiment / observation / checker;observation-only 接口示意;屏幕文字「observation-only 接口 = 防 reward hacking」;画面元素 = 三层堆叠方框 + 红色禁止图标盖在「直接发布动作」箭头上;运动方式 = 三层依次展开,禁止图标下滑到位。
  3. 跨 5 embodiment 几何动画 (10s):五件并列的几何色块代表 manipulation / mobile manipulation / locomotion / driving / aerial control,五条 control profile 弧线汇聚到中央 Harness;屏幕文字「跨 5 embodiment 84 任务」;画面元素 = 5 色块 + 5 弧线 + 84 任务计数;运动方式 = 色块依次点亮,弧线汇向中心,数字 84 跳动一次。
  4. 抽象证据卡 (8s):标题卡展示 4 项关键数字 verbatim = RobotWorld + 跨 20 项目 Harness + 84 任务 + observation-only;屏幕文字「20 项目 + 84 任务 + observation-only」;画面元素 = 四宫格数字 + 黑底高对比;运动方式 = 四格依次亮起,鼠标指示样式高亮 84。
  5. ASTRA vs Opus 5.5 对比 (12s):双柱状图 = Astra 空间 + 受限接触 / Opus 5.5 连续平衡 + 限时交互,叠加字幕「差异原因不明」;屏幕文字「ASTRA 强空间 · Opus 强平衡」;画面元素 = 双柱状图 + 「未控制策略」注释;运动方式 = 双柱依次拉高,「未控制策略」闪两下提示。
  6. 系统性失败级联 (12s):四步级联流程 = 物体状态丢失 → 无效动作未纠正 → 恢复太迟 → 未完成误判完成,每步一个失败小图标;屏幕文字「四步级联失败 = 物理控制 gap」;画面元素 = 四格级联 + 红色斜杠;运动方式 = 四格依次点亮再连成一条线,线端跳出惊叹号图标。
  7. 行动清单 (10s):三栏风险卡 + 行动清单一栏 = 解耦 Harness / 样本数扩或上 bootstrap / 任务权重分别评估;屏幕文字「先解耦 Harness,别让单 episode 定结论」;画面元素 = 三栏 + 一栏行动清单 + 深石墨灰主背景;运动方式 = 风险卡逐条淡入,行动清单最终定格,主色蓝绿色辉光回归到 Harness 图标。