Object-Centric Residual RL for Zero-Shot Sim-to-Real VLA Enhancement

  • 关联论文:2606.18953
  • 作者:Tom
  • 更新:2026-07-22

一句话结论

仅在仿真中训练、以物体位姿(object pose)为条件学习修正策略,无需任何真实机器人数据或额外演示,即可将 VLA 零样本从 42% 成功率提升至 76%。


解决什么真问题

Vision-Language-Action(VLA)模型通过海量互联网数据预训练,已具备一定的跨任务泛化能力,但其底层策略依赖 Imitation Learning(行为克隆),在精密物理交互中会因误差累积而迅速崩溃。真实机器人场景(抓取、插拔、装配等)对精度要求极高,VLA 的基础动作往往差几厘米就全盘失败。

一个直观的解法是 Residual RL——在冻结的 VLA 之上叠一层修正策略,让后者学习"如何纠正 VLA 的错误"。但这在 Sim-to-Real 迁移上陷入了两难:

现有方法 问题
Privileged-state( privileged information) 需要蒸馏到可部署策略,信息损失严重
Image-based 残差 视觉 domain gap 太大,仿真中学到的修正无法泛化到真实相机
Real-world RL 需要真实机器人收集数据,成本高且存在安全风险

本文的核心问题是:能否设计一个残差 RL 框架,让修正策略完全在仿真中训练、零样本直接迁移到真实机器人,且不依赖 privileged information?


核心方法

关键洞察:物体位姿是 sim-to-real 的最优桥接变量

本文发现,物体位姿(object pose)天然具有几何与语义双重不变性

  • 几何不变性:6DoF pose 在仿真和真实环境中描述的是同一个物理量(位置 + 朝向),不受纹理、光照、相机参数影响。
  • 语义不变性:pose 与任务语言描述("拿起蓝色方块")天然对齐,LLM/VLA 已理解这种语义。

因此,残差策略的观测空间从 raw pixels 替换为 object pose + proprioception + base VLA action,大幅压缩了观测维度,使 sim 和 real 的观测分布高度重叠。

整体框架:Object-Centric Residual RL

真实机器人                    仿真环境
┌─────────────────┐         ┌─────────────────────────┐
│  Real VLA (冻结) │         │  Sim VLA (训练出来的)   │
│  输入: 图像+语言 │         │  输入: 渲染图像+语言    │
└────────┬────────┘         └──────────┬────────────┘
         │ 动作 a_VLA                    │ 动作 a_simVLA
         ▼                               ▼
┌─────────────────┐         ┌─────────────────────────┐
│ 物体位姿估计器   │         │ 物体位姿(已知)        │
│ (RealSense/SE3) │         │                         │
└────────┬────────┘         └──────────┬────────────┘
         │ pose_real                     │ pose_sim
         └──────────┬────────────────────┘
                    ▼
         ┌─────────────────────┐
         │  残差策略 π_θ       │
         │  输入: pose, prop., │
         │        a_base       │
         │  输出: δa(修正量) │
         └──────────┬──────────┘
                    ▼
         ┌─────────────────────┐
         │ a_final = a_base    │
         │      + δa           │
         └─────────────────────┘

Sim VLA 对齐:消除 VLA 层面的 domain gap

仅有 pose 的不变性还不够——因为 base VLA 在 sim 和 real 上的行为本身就不同(同一个语言指令,sim VLA 和 real VLA 输出的 action 分布会有偏差)。

本文的解法是:在仿真中重放同一套遥操作演示(teleoperation demonstrations),训练一个 Sim VLA——使其与 Real VLA 对齐到相同的输入-动作映射。训练完成后,Sim VLA 就是 Real VLA 的可验证替身。

训练细节

  • 残差策略架构:MLP(原文未明确层数),输入 concat(pose_noise, proprioception, a_base),输出 7维 delta(position ×3, rotation ×3, gripper ×1)。
  • Noise Injection:训练时对 pose 加入均匀噪声(原文未明确幅度),迫使策略学会处理位姿估计误差。
  • Dropout:在 pose 输入层加 Dropout,增强对不完美位姿估计的鲁棒性。
  • RL 算法:原文未明确(可能是 PPO 或 SAC),这是 paper card 的已知信息缺口。
  • Zero-shot 部署:训练完成的 π_θ 直接部署到真实 FR3 机器人,无需任何微调。

自提升(Self-Improvement)循环

修正后的 rollout 数据(成功轨迹)可以回放给 Base VLA 做行为克隆,在不额外采集遥操作数据的前提下让 VLA 本身变得更好——相当于用 RL 信号给 Imitation Learning 打补丁,形成闭环。


关键实验与数据

实验平台:Franka Research 3(FR3)机械臂,5 个灵巧操作任务(原文未列出具体任务名,是 paper card 的信息缺口)。

任务 Base VLA 成功率 本文方法成功率
5 项操作任务平均 42% 76%
  • 自提升效果:用改善后的轨迹重新训练 VLA,进一步提升(具体数字原文未给出)。
  • Ablation:移除 pose 条件(纯图像残差)→ 成功率下降至接近 Base VLA 水平,证明 pose 是迁移成功的关键。
  • Sim VLA 对齐的必要性:ablation 中,不训练 Sim VLA 直接迁移 → 效果显著下降。

亮点与局限

亮点

  1. **pose as bridge:以物体位姿替代图像作为迁移媒介,是从 physics-based 仿真继承的思路,却恰好解决了视觉 domain gap 的根本问题——漂亮的方向转换。
  2. 无需真实数据:完全在仿真中训练,避免了 Real-world RL 的安全和成本问题。
  3. Self-improvement 闭环:修正轨迹可复用,给 VLA 本身打补丁,形成可迭代的正向循环。
  4. 工程简洁:残差策略是轻量 MLP,不引入额外的视觉模型,推理开销小。

局限

  1. 依赖位姿估计器:真实侧需要 RGB-D/深度传感器及可靠的 6DoF 估计算法,在严重遮挡或透明物体场景中位姿估计本身可能失效。
  2. Sim VLA 对齐需要演示数据:仍然需要人工遥操作演示来训练 Sim VLA,未实现完全自动化。
  3. 任务范围:仅验证了 5 项操作任务,在更复杂、长时序的任务上效果未知。
  4. 未公开 RL 算法细节:影响复现性,是本文的一个信息缺口。

对工程落地的启发

  • VLA + Residual RL 组合:对于精度要求高的操作任务(装配、插拔),直接让 VLA 负责高层规划(语言→任务),而用轻量修正策略兜底执行精度,是可行且经济的路线。
  • Pose-based sim-to-real:如果场景允许接入深度传感器或已有点云,先做位姿估计再控制,比端到端视觉策略更容易迁移。
  • Self-improvement 价值:对数据稀缺的机器人场景,能用少量成功轨迹迭代 VLA 本身,比持续收集遥操作数据更可持续。
  • 仿真基建优先:本文效果很大程度上依赖仿真质量(物体模型、动力学参数),投资高质量仿真环境是这类方法的底层前提。

与同方向工作的关系

  • Residual RL:继承自 [Coulom 2002, Johannink et al. 2019] 等残差策略路线,但聚焦在 VLA 场景和物体位姿这一具体桥接变量上。
  • VLA + RL 融合:与 RT-Trajectory、Pivot 等近期的 VLA 泛化工作同属一个方向,但本文不微调 VLA,而是冻结 VLA、单独训修正策略——模块化更强。
  • Sim-to-Real:与 Domain Randomization(RUDN)、DARLA 等视觉迁移方法同代,但本文通过 pose 跳过了视觉迁移的核心问题,路线完全不同。
  • GR00-T、OpenVLA:这些是大模型路线,本文属于小模型+RL路线,互补而非竞争——大模型负责泛化,小策略负责精度。

适合谁读

  • 机器人研究:尤其是 Manipulation + VLA 方向,想了解如何低成本提升 VLA 在真实机器人上的成功率。
  • Sim-to-Real 研究:对"如何在仿真和真实之间建立有效桥接变量"感兴趣的学者。
  • LLM/Robot 跨模态工程师:想了解 Residual RL 在 Physical AI 场景中的实际工程价值的实践者。
  • 对 VLA 泛化问题有基础了解的读者,需要熟悉 Imitation Learning 和 RL 的基本概念。

不确定处(原文未明确): - 具体使用的 RL 算法(PPO/SAC/TD3 等) - 5 个任务的具体名称 - Pose noise 的幅度范围 - Sim VLA 训练的 epoch 数或收敛判据 - 残差策略 MLP 的具体架构(层数、宽度)


工程落地与核查(Jay)

实际系统怎么用

部署路径(三步走)

  1. 仿真侧(Isaac Sim / PyBullet / MuJoCo):构建含目标物体 URDF 的仿真场景;冻结 base VLA(OpenVLA / RT-2)接入仿真,产生 baseline action;采集少量遥操作演示,训练 Sim VLA 使其 action 分布与 Real VLA 对齐。

  2. 残差策略训练:MLP(输入 concat(pose_noise, proprioception, a_base),输出 7 维 δa);pose 在仿真中取 ground-truth,真实侧靠 RGB-D(RealSense / Azure Kinect)+ SE3 估计器(GTCD / SAM-6D);训练加 pose noise + Dropout 处理不完美估计。

  3. Zero-shot 部署:π_θ 在 FR3 上直接推理,无需微调;位姿估计器实时输出 pose → concat → MLP → δa;最终 action = a_VLA + δa,经 Franka API 发送。

推理开销:MLP 在 CPU 推理约 1ms 量级,与 VLA forward 独立叠加,实时性可控。


坑在哪

严重程度 应对
位姿估计器失效(遮挡 / 透明物体 / 缺乏纹理) 备用 ICP 点云匹配;极端场景降级纯图像残差(性能回退)
Sim VLA action 分布漂移 定期 re-align 或用 domain randomization 覆盖 real 分布
未见物体类别泛化差 新物体须重训 sim 数据;当前只在训练类别上验证
FR3 以外机器人兼容性 Δaction 格式依赖末端执行器;协作臂需重映射 action space
RL 算法黑盒(原文未公开) 低(已标注) 建议 PPO 默认实现;收敛性需自行调参验证
仿真物理参数失配(摩擦力、弹性、接触刚度) 仿真侧系统辨识或 domain randomization;real FR3 需物理校准

核查注记(⚠️ 原文存疑处)

  • 42%→76% 的 5 项任务具体名称:原文未列,paper card 阶段已标注为信息缺口;数字本身来自原文 table,但任务域未知限制了跨任务迁移预期的可靠性。
  • Sim VLA 对齐的具体实现:原文只说"重放同一套遥操作演示",未给训练 loss、epoch 数或收敛判据;实际复现需自行调参。
  • Pose noise 幅度:未给出,影响对不完美位姿估计鲁棒性的可复现评估。