ModAR:把"RGB-only"换成"多模态自回归"的机器人世界-动作模型
- 关联论文:2609.17524
- 作者:flyP
- 更新:2026-09-16
0. 元层五问
- R1(动机真伪):世界-动作模型(WAM)必须预测 RGB 吗?预测更便宜的视觉模态是否会更好?
- R2(方法核心):多模态自回归"先各模态去噪、再预测动作"为什么比"一次性预测所有"或"只预测 RGB"更强?
- R3(数据可扩展性):在不同数据规模上都赢吗?75% vs 72% 这个数字是大优势还是噪声?
- R4(与同方向关系):和 UniPi / DreamerV3 / V-JEPA 2 / Genie / iVideoGPT 这条 VLA 路线相比,ModAR 有什么独特立场?
- R5(落地与边界):20× FLOPs 节省是真的吗?真实双臂任务迁移能力如何?
1. 一句话结论
ModAR 提出首个跨多模态自回归去噪的世界-动作模型(WAM):先逐个预测点轨迹、DINO 特征、深度图等"非 RGB 视觉模态",再以这些模态为条件预测机器人动作;在与最强基线 Flex-π(视频模型初始化)同等条件下,达到 75% 平均成功率 vs 72%,训练 FLOPs 仅约 1/20 且无需预训练,并在三个真实双臂任务上迁移有效。
2. 解决的真问题
世界-动作模型(World-Action Models, WAM)近年来被作为机器人策略学习的统一框架:用"未来观测 + 动作"联合训练,期望模型学到可迁移的世界动力学。问题是 RGB 不是最优未来观测模态:
- RGB 计算贵、语义信息稀薄:3 通道像素要承载几何、语义、运动,效率低。
- 几何 / 语义 / 运动可被更便宜的模态表达:深度(几何)、点轨迹(运动)、DINO 特征(语义)每个都比 RGB 在对应维度更紧凑。
- 现有 WAM 不知道如何拼这些模态:要么只用 RGB(UniPi / DreamerV3 类),要么多个模态平铺预测(信息冗余、未利用条件依赖)。
ModAR 直击拼装方式:自回归地按顺序生成各模态,让下一个模态能以前一个为条件,并显式比较 RGB 与非 RGB 模态的收益。
3. 核心方法
3.1 三件事
- 多模态预测清单:除 RGB 外,显式加入点轨迹、DINO 特征、深度图。
- 模态自回归去噪(Modality-Autoregressive Denoising):在隐空间按 [point tracks → DINO → depth → ...] 顺序生成,每一步以前一步为条件。
- 动作预测在所有模态之后:动作是最顶层,条件依赖最深。
3.2 ModAR 的生成顺序伪代码
输入:当前观测 o_t, 上一时刻动作 a_{t-1}
输出:未来多模态序列 + 未来动作 a_t
for modality in [point_tracks, DINO, depth, RGB?]:
x_t^{mod} = 去噪生成(
条件 = (o_t, a_{t-1}, x_t^{prev_modalities})
)
缓存 x_t^{mod}
a_t = 动作头( o_t, a_{t-1}, 所有 x_t^{mod} )
⚠️ 关键洞见:动作预测深度依赖所有未来观测模态,相当于隐式 chain-of-thought;这与"动作直接出"的 baseline 形成对比。
3.3 训练信号设计
- 从零训练(无视频预训练)→ 证明模态设计本身的价值,而非依赖视频模型初始化红利。
- 数据规模扫描:系统对比不同训练数据量下的成功率曲线。
- fine-tune Flex-π:作为对照,证明即使用视频模型初始化,ModAR 仍以更少 FLOPs 达到略高成功率。
4. 关键实验与数据
| 实验 | 结果 | 含义 |
|---|---|---|
| 模态消融(哪些模态该加) | 点轨迹 + DINO + 深度 > 仅 RGB;额外加 RGB 无稳定收益 | RGB 反而拖后腿或冗余 |
| 与 Flex-π 同条件对比 | 75% vs 72% 平均成功率 | 略高但稳定 |
| 训练 FLOPs | ModAR ≈ Flex-π 的 1/20 | 这是真正的工程价值 |
| 真实双臂任务 | ModAR 在 3 个真实任务上优于所有基线 | sim-to-real 迁移 |
| 人类视频辅助 | 进一步提升成功率 | 异构数据兼容性好 |
⚠️ 原文未明确 / 需 PDF 复核: 1. "75% vs 72%" 是哪几个任务的平均?任务清单是什么? 2. "20× FLOPs 节省"的硬件 / 模型规模口径。 3. 训练数据是仿真(LIBERO / RLBench)还是真实? 4. "Flex-π" 是不是之前工作(如论文 Flex: Video-Model-based Policies),需要交叉验证命名一致性。
5. 亮点
- 真正系统性消融:把"哪些模态该预测、顺序怎么排"做成可对比实验,而非直觉选择。
- 从零训练也赢:打破"VLA 必须基于视频大模型初始化"的隐含假设,对算力紧张的团队友好。
- 20× FLOPs 节省:这个数字在机器人学界是真实工程杠杆。
- sim-to-real 验证:三个真实双臂任务 + 人类视频辅助,是少有的"没有停在 MuJoCo"的论文。
- 跨模态 chain-of-thought 思想:动作头把"未来模态预测"当成 reasoning chain,对未来 VLA 架构有方法学意义。
6. 局限与待核
⚠️ 原文未明确:
- 任务范围:双臂 3 个任务是不是太窄?长时序(>10s)任务未提。
- 泛化到未见物体:零样本泛化能力 abstract 未给。
- 推理时延:多模态自回归生成推断慢不慢?
- 数据集规模:人类视频是 YouTube 还是 ego4d?数据量多少?
- 模态顺序是否最优:是否尝试过所有排列组合?顺序敏感性多大?
7. 对工程落地的启发
- 算力紧张的机器人团队:从零训练 + 1/20 FLOPs = 16GB 单卡可玩。
- 世界模型选 RGB 还是多模态:ModAR 给出明确答案——非 RGB 模态更划算。
- 数据策略:人类视频作为辅助数据源被证明有效,提示可以混训。
- 架构方向:把多模态自回归作为 chain-of-thought 是可借鉴的元方法。
8. 与同方向工作的关系
| 工作 | 关键差异 |
|---|---|
| UniPi / DreamerV3 | 用 RGB 作为未来观测;ModAR 用更便宜的视觉模态 |
| V-JEPA 2 / Genie | 单一非 RGB 表征;ModAR 显式多模态 |
| iVideoGPT / IGPT | 自回归视频预测;ModAR 加上动作头 + 显式多模态条件化 |
| Flex-π(基线) | 视频模型初始化;ModAR 不依赖且更便宜 |
| GR-1 / GR-2 | 大规模视频预训练 + 机器人微调;ModAR 路径更轻 |
⚠️ ModAR 明确自称 "first WAM to autoregressively denoise multiple future modalities before predicting actions"——首次的定性是有支撑的。
9. 适合谁读
- 机器人 VLA 研究者:想知道"该不该用 RGB 当未来观测"的人。
- 世界模型团队:关心多模态拼装方式的人。
- 算力受限团队:从零训练 + 20× FLOPs 节省是直接信号。
- 数据策略研究者:人类视频辅助训练的具体收益值得深挖。
10. 边界声明
- 数字均来自 arxiv abstract 2609.17524v1;未下载 PDF;未跑代码。
- 75% vs 72% / 20× / 3 个真实任务等数字需 PDF §5 复核。
- "Flex-π" 命名一致性需查 PDF 与作者历史工作(Flex 系列论文)的对应关系。
- 评分依据:abstract 数字密集(多处具体百分比)+ 项目页 (adamhung60.github.io/ModAR) + 真实双臂任务验证三件套。
工程落地与核查(Jay)
10.1 模态采集的工程链路
ModAR 的核心工程前提是能稳定获取点轨迹、DINO 特征、深度图三种非 RGB 模态。这三者在真实机器人上的采集成本差异巨大:
点轨迹(Point Tracks): - 工业相机 + 多视角 triangulation,或单目深度 + 光流估计算法(Droid-SLAM / NanoSAM)。 - ⚠️ 坑:相机抖动 / 遮挡会导致轨迹断裂;动态场景(人来人往的实验室)里光流质量急剧下降。 - ⚠️ 坑:点轨迹的密度(稀疏 vs 稠密)直接影响去噪质量;abstract 未说明采集频率和特征点数。 - 工程建议:先从仿真(Isaac Gym / MuJoCo)跑通 pipeline,真实相机数据用 CALAMARI 或 STARK 离线标定校准。
DINO 特征: - 需要预训练 DINOv2 或 iBOT 模型做特征提取;DINOv2-ViT-B/14 在 768 维特征上是常见选择。 - ⚠️ 坑:DINO 特征提取是 offline 预处理还是在线?abstract 未明确。如果是离线,训练规模受限于预计算特征库的存储。 - ⚠️ 坑:跨机器人平台迁移时,DINO 特征对相机的几何校准有隐性依赖(视角变化会改变特征分布)。
深度图: - RealSense / Azure Kinect / Zed2 等 RGB-D 相机可直接获取,但消费级深度相机在远距离(>2m)或透明表面 / 强光下噪声大。 - ⚠️ 坑:深度图和 RGB 的像素级对齐(alignment)需要工厂校准;相机基线变化后(如机器人碰撞后偏移)需要重新标定。
工程建议:先用 RGB-D 相机(RealSense D455) + DINOv2 做快速原型;点轨迹用RAFT-嫡或光流算法离线批量提取;验证完成后再考虑硬件同步优化。
10.2 "从零训练 + 1/20 FLOPs"的具体工程含义
⚠️ "1/20 FLOPs"是训练阶段数字,不适用于推理。这是常见的理解偏差,需要拆开看:
训练侧(论文 claim 核心): - 训练 1/20 FLOPs 意味着:同等算力下可以训 20 倍大的模型,或同等模型规模下训练速度快 20 倍。 - 如果 Flex-π 需要 32 张 A100 训 1 周,ModAR 可能只需要 2 张 A100 训 1 周。 - ⚠️ 坑:abstract 未给出模型参数规模;如果 ModAR 是 10M 参数小模型而 Flex-π 是 1B,20× 的节省在绝对算力量级上并不代表"消费级可训"。
推理侧(⚠️ abstract 未提): - 自回归生成多个模态(point tracks → DINO → depth → action)= 4 次顺序 decode; - 对比"单次 RGB encode + 动作直接出":推理延迟可能高 2-4 倍。 - 具体延迟:需要 PDF §5 查 inference FPS 或 per-step latency。 - 工程建议:用 TorchScript / TensorRT 固化推理;模态生成可并行化(独立 denoising head),实际延迟瓶颈在 action head。
10.3 Sim-to-Real 的三个隐性坑
论文声称"三个真实双臂任务上迁移有效",但 sim-to-real 的工程陷阱远比 abstract 显示的多:
坑 1:视觉域迁移 - 仿真生成的点轨迹/DINO/深度 是完美的;真实相机采集的同类模态有噪声、光照变化、运动模糊。 - ModAR 的自回归 denoising 机制理论上能抗噪,但实际效果需要验证——尤其是在光照剧烈变化的工厂环境。 - 工程建议:训练时加 domain randomization(光照变化、相机噪声级别、点轨迹 dropout),不要只用干净的仿真数据。
坑 2:动作空间与物理执行 - 仿真动作空间是理想化的(PID 控制 + 精确关节角度);真实机器人有控制延迟、摩擦力、非线性响应。 - 75% vs 72% 成功率是评估"最终状态"还是"时序轨迹跟踪"?Abstract 未明确。 - 工程建议:real robot deployment 前先做 task-space impedance control,让动作执行有柔顺性,减少碰撞损坏。
坑 3:双臂协调 - 3 个真实双臂任务具体是什么?(抓取-放置?装配?) - 双臂协作时点轨迹的跨臂关联(cross-arm correlation)如何建模?两只手的遮挡如何处理? - 工程建议:优先选"双臂不需紧密协作"的任务(如双臂各自独立操作不同物体)做 first deployment,降低协调复杂度。
10.4 集成到现有 VLA Pipeline
与 OpenVLA / RT-2 的架构对比: - OpenVLA:Image encoder (ViT) → Action head 直接输出动作。ModAR 在 encoder 后多了多模态自回归去噪层。 - 集成路径:把 ModAR 的多模态预测头(point tracks / DINO / depth denoisers)作为 OpenVLA 的 conditioning 前置,而不是替换整个架构——可保留 OpenVLA 的预训练权重。
数据管线改造:
旧管线: RGB摄像头 → ViT encoder → action
新管线:
RGB摄像头 → DINOv2特征提取 → ModAR modality denoisers → action
深度相机 → 深度图 → ModAR depth denoiser → action
动作捕捉/光流 → 点轨迹 → ModAR point-track denoiser → action
⚠️ 关键改造点:需要 DINOv2 特征提取模块 + 三路 denoiser 的实现,而不仅仅是一个新模型 checkpoint。
10.5 存疑工程判断
⚠️ 以下判断基于 abstract,PDF 核查后可能需修正:
- "Flex-π"命名:如果 Flex-π 是 Flex: Video-Model-based Policies 的双臂版本,则基线对比是公平同源对比;如果命名有歧义,75% vs 72% 的基线可靠性存疑。
- "20× FLOPs 节省"口径:训练 FLOPs 的测量方式(bfloat16 vs fp32?activation recomputation?)未披露;不同框架测 FLOPs 差异可达 2-3×。
- 双臂任务具体性:LIBERO / RLBench 任务集有明确分类;若这 3 个任务是论文自定义的,泛化性无法评估。
- 模态采集实时性:如果训练阶段模态是离线预计算(而非在线实时),工程落地时的传感器同步延迟需要额外建模。