World Action Agent:用 VLM 操控机器人的世界-动作排练框架

  • 关联论文:2609.29964
  • 作者:Tom
  • 更新:2026-09-25

一句话结论

World Action Agent(WAA)提出让 VLM 在一个视觉动作工作空间中直接「排练-修正-执行」机器人操作,通过 Contact Views、Action Rehearsal 和 In-View Correction 三项机制,在 LIBERO-Pro 上以 75.6% 平均成功率刷新 SOTA,并将 9B 模型 out-of-domain 泛化从 1.7% 提升至 43.3%。

解决什么真问题

通用 VLM 具备广泛知识与空间推理能力,但现有机器人操控系统存在两条路径缺陷:

  1. 间接使用:VLM 只负责预测约束或生成代码,机器人实际执行仍由传统控制器完成——VLM 的泛化能力无法直接作用于动作层
  2. 场景观察而非行动空间:现有系统给 VLM 提供的是「场景的画面」而非「可以行动的世界」——模型无法直接在世界模型中做决策

这导致 VLM 的知识与机器人实际操控之间存在执行 gap,尤其在 out-of-domain 场景中泛化极差(Qwen3.5-9B 仅 1.7%)。

核心方法

视觉动作工作空间(Visual Action Workspace)

WAA 的核心是让 VLM 在一个专门的视觉工作空间中完成所有决策,该空间具备三个特性:

① Contact Views(接触视图) 根据场景几何自动选择的视图,展示当前交互点周围的场景区域——让 VLM 始终聚焦于「机器人当前要操作的位置」而非无关背景。

② Action Rehearsal(动作排练) 每个候选动作被转化为一个可编辑的 proposal,VLM(独立或通过 Imagination Agent)先预览该动作,在规划反馈下修正,最后才执行:

Action Rehearsal 流程:
1. VLM 生成候选动作 proposal(可编辑)
2. Imagination Agent 在虚拟空间预览该 proposal
3. 基于规划反馈修正 proposal
4. 修正后执行(真实机器人)

③ In-View Correction(视野内校正) 在观测-排练-低层执行的闭环中,VLM 能在 view 中直接识别并消除残余偏移——无需回到全局规划层,闭环在局部视野内完成。

技能获取双轨

WAA 通过同一工作空间以两种方式获取技能:

从专家视频和人类教学进化(LIBERO-90 数据): - 专家视频 + 人类演示 → multimodal skills - Evidence-based review 过滤低质量示范 - Skill Agent 负责在需要时检索相关技能

从交互轨迹微调 VLM: - WAA 的交互 trace 收集为微调数据 - 用 Qwen3.5-9B 在 harness traces 上微调 - 微调后模型可直接 pilot 同一 harness

关键实验与数据

实验设置 结果
LIBERO-Pro 平均成功率 75.6%(SOTA)
对比 end-to-end VLAs WAA 显著优于 end-to-end VLA 基线
对比 code-as-policy agents WAA 显著优于代码策略类 Agent
对比 visual-harness baseline(相同 backbone) WAA 优于 visual harness 基线
跨平台迁移(LIBERO → robosuite) 技能无需进一步学习即可迁移
Qwen3.5-9B 微调后 OOD 泛化 1.7% → 43.3%(+41.6pp)

⚠️ 原文未提供各 baseline 的具体对比数值(绝对百分比),以上为相对关系描述;1.7% 和 43.3% 为 abstract 明确数据。

亮点与局限

亮点: - 首次提出「视觉动作工作空间」概念,让 VLM 在世界模型中而非场景图像中做决策 - Action Rehearsal 机制将「规划-预览-修正-执行」闭环化,减少真实世界试错 - 双轨技能获取(视频进化 + 轨迹微调)兼顾泛化性与专用性 - Out-of-domain 泛化从 1.7% 到 43.3% 的跨越验证了方法的有效性

局限: - LIBERO-Pro / robosuite 为仿真环境,真机迁移效果原文未明确验证 - Imagination Agent 的设计细节(如何构建虚拟预览)在 abstract 中未展开 - Contact Views 的自动选择算法依赖场景几何感知,对透明/反光物体鲁棒性未知 - 技能从 LIBERO-90 进化而来,跨任务域(如家庭场景)泛化能力待验 - WAA 目前基于特定机械臂配置设计,硬件通用性未评估

对工程落地的启发

  1. Action Rehearsal 即预执行验证:在真实机器人部署前加入「在虚拟/想象空间中预览」的步骤,可大幅降低失败率和试错成本
  2. In-View Correction 简化控制回路:局部视野内校正比全局重规划更高效,适合需要低延迟响应的操控场景
  3. 多模态技能库 + Skill Agent:构建可检索的技能库并由 Agent 主动调用,是将人类演示知识复用到新任务的可行范式
  4. Harness Traces 微调:收集 human-in-the-loop 或其他 Agent 的交互轨迹来微调 VLM,是低成本的泛化提升路径
  5. VLM 机器人落地的两条路:直接让 VLM 在 world space 中决策(WAA 路线)vs. VLM 生成代码/约束交控制器执行(传统路线),WAA 提供了前者的工程参考

与同方向工作的关系

相关工作 WAA 的差异
Code-as-Policy(Liang 2022) VLM 生成代码交给控制器;WAA 直接在视觉空间做动作决策
VoxPoser(Huang 2023) VLM 在 3D 体素空间建模;WAA 在视觉动作工作空间中运作
RT-2/PaLM-E(end-to-end VLAs) 端到端视觉-动作映射;WAA 加入 rehearsal/correction 中间层
3T/芝麻开门类视觉抓取 WAA 通过 rehearsal 机制避免盲目抓取,加入规划层
LIBERO 基线方法 WAA 在同一 LIBERO-Pro 上刷新 SOTA,验证了 VLM 直接操控的可行性

适合谁读

  • 机器人 + VLM / MLLM 研究者:关注 VLM 如何直接参与低层动作决策
  • Manipulation / 操控方向工程师:希望了解 Action Rehearsal + In-View Correction 的工程实现
  • Sim-to-Real / 跨平台迁移:WAA 展示了仿真策略迁移至 robosuite 的初步验证
  • Agent + Robotics 交叉方向:Skill Agent 的设计模式对多技能机器人系统有参考价值

⚠️ Imagination Agent 细节、Contact Views 自动选择算法、各对比 baseline 绝对数值需读正文获取,本文基于 abstract + TLDR 撰写。