Grounded Action Model:把"物体在哪里"先解决,再让机器人动手

  • 关联论文:2609.23863
  • 作者:flyP
  • 更新:2026-09-22

§0 元层五问

  • Q1(机制):在 VLA(vision-language-action)/ WAM(world-action model)的 backbone 之外,把"3D 物体接地"作为一等公民显式建模——语言 / 点 / box 三种 prompt 先映射到一个 object-centric 表示(含目标物体视觉特征 + metric 几何),再与机器人状态历史一起经多流 transformer 预测 action chunks。
  • Q2(数据):RoboTwin 2.0(50 任务 / 47.6% 场景随机化)/ LIBERO-PRO(16 扰动设置 / 61% 平均成功)/ 双臂 YAM 真实机器人(视觉偏移 17/20)/ Franka + Molmo2 planner(64.7% ID / 49.8% OOD 长程)。
  • Q3(截止日 / 证伪):6 个月内若有 ≥3 独立团队在 LIBERO-PRO 16 扰动上用 object-centric 接地 + action chunk 复现 ≥60% 平均成功,即方法学可迁移;若同样条件下 ≥3 团队只能复现 ≤50%,则证伪。
  • Q4(受众):机器人 foundation model 团队 / 操控策略研究者 / VLA / WAM / 长程任务规划研究者。
  • Q5(风险):3D 接地依赖 metric 几何真实可用,对单目 / 弱纹理 / 高反光场景可能塌方;object-centric 表示依赖预训练感知器质量。

§1 一句话结论

把"3D 物体在哪里"这件事从 VLA/WAM 的隐式学习中抽出来做成显式接地,再叠加到动作预测上:在 RoboTwin 2.0 50 任务平均 55.3% / 场景随机化 47.6%(vs Abot-M0 30.4%)/ LIBERO-PRO 61%(vs π0.5 53%)/ 真实机器人视觉偏移 17/20(vs π0.5 4/20)。

§3 它在解决什么真问题

机器人基础模型(robot foundation models)最近一年沿两条线推进:

  • VLA(vision-language-action):把视觉 + 语言 + 动作拼到一个端到端模型(典型如 π0 / π0.5 / RT-2)。
  • WAM(world-action model):把视频生成模型当作世界模型,再用世界模型预测 action(典型如 V-JEPA 2 / GAIA-1)。

两条线的隐含假设是"机器人 backbone 会自动学到'物体在哪里'这个 metric grounding 信息"。⚠️ 但视觉语言模型预训练目标是"识别 / 描述 / 接地到 bounding box",视频生成模型预训练目标是"未来帧像素",都不直接要求 metric 几何。结果是:物体在哪儿这件事,机器人 backbone 只能从机器人演示数据里隐式学,学得慢、容易在新场景下崩。

GAM 的诊断是:metric grounding 不应该是被隐式学到的东西,应该被显式建模。于是把"3D 接地"提到 backbone 之外做一个独立模块。

§3.1 为什么 object-centric 表示是结构上的关键

把"语言 / 点 / box"三种 prompt 投影到一个共享的 object-centric 表示——包含:

  • 目标物体视觉特征(target-focused visual features)
  • metric 几何(3D 位姿 / 尺寸 / 坐标系)

这条表示与机器人状态历史经多流 transformer 融合预测 action chunks。结构上等价于"perception module + policy head",但 perception module 是用 grounding 任务预训练的,policy head 是在它之上微调的。

§3.2 为什么是“高级鲁棒性"

GAM 仅在 clean-scene 演示训练、场景随机化测试仍能拿到较高成功率,背后的机制是:metric grounding 提供了“物体在哪儿”这个鲁棒性项,环境外观变化(背景 / 光照 / 物体遮挡)不会抹掉“物体在哪儿”的答案。但环境拓扑变化(物体重新放置 / 新指定物体)是 GAM 必须靠 metric grounding 重新定位的场景——这也是 LIBERO-PRO 上 GAM 增益最大的场景。

§3.3 与"能不能做下一件"问题的差别

VLA / WAM 路线的高频失败场景是“场景里出现一件训练时没见过的东西”,比如要求机器人抓起一只没见过的茶壶。GAM 路线能缓解但不能根治——metric grounding 能定位没见过物体,但抓取动作仍依赖见过类似物体的动作经验。两者是不同抽象层上的能力。

§4 核心方法

§4.1 三种 prompt → 共享 object-centric 表示

输入空间被限定为三种接地 prompt:

  • 语言:"pick the red mug on the table"
  • :在图像上点一下物体
  • box:bounding box 框选

三种 prompt 都被映射到同一 object-centric 槽位(slot),共享一组"目标物体特征 + metric 几何"参数。

§4.2 多流 transformer 融合

⚠️ 论文 abstract 未给出 transformer 的具体层数 / 注意力形态 / 参数量级,仅说"multi-stream transformer" + "predict action chunks"。细节需查正文。

§4.3 两种运行模式

  • 自治模式:GAM 直接消费 prompt → 预测 action chunks。
  • 低层控制器模式:GAM 作为低层控制器,被高层 planner(语言 / 点 / box 任意 prompt)调用。这条模式特别重要:GAM 自身可以做"长程 + 记忆依赖"任务,但更稳的形态是"高层 planner 决定做什么 + GAM 决定怎么动"。

§4.4 关键实验数据(abstract verbatim)

RoboTwin 2.0(仿真 50 任务)

  • 平均成功率 55.3%(vs Spatial Forcing 52.0%)
  • 场景随机化条件下 47.6%(vs Abot-M0 30.4%)
  • ⚠️ GAM 的 action policy 仅在 clean-scene 演示训练 —— 这是反直觉的关键点:训练不包含场景随机化,测试却能在场景随机化条件下不掉太多,说明 3D 接地提供了显式的"鲁棒性来源"。

LIBERO-PRO(16 扰动设置)

  • 平均成功率 61%,SOTA
  • vs π0.5 的 53%
  • ⚠️ 增益最大的场景是 target 重新放置 / 新指定:这两个场景恰好最依赖"重新找到物体在哪里"。

真实机器人双臂 YAM

  • 视觉偏移条件下 17/20 成功(vs π0.5 4/20)
  • ⚠️ 这条是 GAM 真实硬件层面的关键证据:π0.5 在视觉偏移下基本崩,GAM 仍能跑。

真实机器人 Franka + Molmo2 高层 planner

  • ID 64.7% / OOD 49.8% 长程 + 记忆依赖任务
  • ⚠️ 这条是"高层 planner + 低层 GAM"组合形态的直接证据。

§4.5 与传统 manipulation pipeline 的架构对比

传统 manipulation pipeline 是"perception → state estimation → planning → control" 四段拼接。GAM 的架构可看作"经整理过的 perception (grounding 任务预训练) + 带状态历史的 transformer + action chunk prediction",仍然是多模块拼接,但拼接点是 object-centric 表示而非"原始像素 / 点云 / 本体感觉"。⚠️ 这种"在表示 / 模块接口"上拼而非在"原始感知 / 低层控制"上拼"的设计哲学,是近年来机器人学习的重要趋势。

§5 亮点与局限

§5.1 亮点(机制 + 数据 + 截止日-证伪)

  • (1) 机制:把"metric grounding"从隐式学习提到显式模块,是 robot foundation model 设计上的范式升级;与 VLA / WAM 不是替代关系而是补充关系。
  • (2) 数据:跨仿真 + 真实机器人两条线 4 个独立基准同步提升(RoboTwin 50 / LIBERO-PRO 16 / YAM / Franka),且全部数字 abstract verbatim。
  • (3) 截止日-证伪:方法学是否独立可迁移需 6 个月内 ≥3 团队复现 LIBERO-PRO ≥60%;若仅原团队可达 SOTA,则需谨慎。

§5.2 局限

  • (1) 机制:3D 接地依赖 metric 几何可获取——单目 / 弱纹理 / 高反光 / 透明物体场景下 metric 几何本身不可靠,⚠️ abstract 未讨论这些 failure mode。
  • (2) 数据:RoboTwin / LIBERO-PRO 是仿真基准,真实机器人仅 2 个 demo(YAM + Franka),硬件样本量有限。
  • (3) 截止日:object-centric 表示的 backbone 来源与训练数据 abstract 未明确——是预训练 3D 检测器?自监督视觉?需看正文。

§6 与同方向工作的关系

  • VLA 系列(π0 / π0.5 / RT-2 / OpenVLA):GAM 与 VLA 不是竞争关系,GAM 的低层控制器形态可与 VLA 的高层决策组合。
  • WAM 系列(V-JEPA 2 / GAIA-1):WAM 想让视频生成模型学到世界动力学,GAM 不走这条路;但 GAM + WAM 的组合("WAM 预测未来 + GAM 抓取")是潜在方向。
  • 3D 接地模型(SAM-3D / Grounded-SAM / ConceptFusion):GAM 的 grounding 模块与这些工作直接对接。
  • RoboBrain / Spatial Forcing / Abot-M0(被 GAM 击败的对象):同类工作的代表,GAM 在相同基准上 SOTA。

§6.1 与 Molmo2 高层 planner 的关系

GAM 在 Franka 上与 Molmo2 planner 组合:Molmo2 给出"先做什么后做什么"的高层指令,GAM 把每步指令转成动作。这条"high-level planner + low-level GAM"模式,与"end-to-end VLA"是对立的——后者尝试用一个模型吃掉所有层级,前者把层级显式分。

⚠️ 哪种路线最终胜出,⚠️ 取决于"任务复杂度上限" vs "端到端容量"的天平,目前两条路都在快速迭代。

§6.3 与“推理时接地”路线的对比

另一条独立路线是“推理时 grounding”(e.g., SayCan / Code-as-Policies / ReKep):让 LLM 推理时调用 grounding 模块 / 路径规划模块 / 控制模块。与 GAM 的差别是:GAM 是“表示层接地 + 端到端训练”,推理时接地是“推理层拼接 + 模块独立调用”。前者训练代价高但推理时快,后者训练代价低但推理时需要多次调用。两者是设计哲学上的两个极端。

§7 对工程落地的启发

  • 任何 VLA 团队都该把 GAM 的"object-centric 表示"作为可插拔模块试一遍,可能在 3D 几何需求强的场景上拿增益。
  • 真实机器人部署优先考虑"高层 planner + 低层 GAM"组合形态,比纯端到端 VLA 在长程任务上更可控。
  • 训练数据可不强行堆场景随机化:GAM 仅在 clean-scene 演示训练仍能在场景随机化测试中不掉太多,⚠️ 节省了真实机器人演示采集成本。
  • 7 段工程落地建议(按主线分):
  • 机制:把"metric grounding"作为独立 backbone 评估指标(物体 6D 位姿预测误差),不只看端到端任务成功率。
  • 数据:仿真 + 真实机器人两条线评测,仿真用 LIBERO-PRO 16 扰动 + RoboTwin 场景随机化;真实机器人用双臂 YAM 视觉偏移做回归测试。
  • 截止日:3 个月内把 GAM 的低层控制器形态接到自家 VLA / 任务规划系统上做对照实验。
  • 证伪:如接入后任务成功率提升 ≤2pp,需重审 object-centric backbone 质量。
  • 资源:单目 + 弱纹理场景准备 metric 几何 fallback(深度补全 / 多视角融合)。
  • 安全:长程任务保留人类接管入口,高层 planner 出错时 GAM 不能单方面执行。
  • 评测:跨 4 个独立基准(RoboTwin / LIBERO-PRO / YAM / Franka)联合做 SOTA 申报,单基准破门比丢 3 分。

§7.1 对企业机器人团队的三条路径建议

  • 路径 A:低风险——先拿 GAM 作为低层控制器接到现有 VLA 上,避免重新训整个 VLA,适合短期 POC。
  • 路径 B:中风险——单独训 GAM-style grounding backbone 作为独立 module,接入原 manipulation pipeline,适合中期产品改造。
  • 路径 C:高风险——端到端重训,以 GAM 架构为参考重新设计整个机器人基础模型,适合下一代平台。

每条路径都需独立制定 3-6 个月验证表,避免“一条路走到黑”。⚠️ 论文未明确提供这三条路径的证据链,需结合本团队实际数据补充验证。

§八 适合谁读

  • 机器人 foundation model 团队(直接受益)
  • VLA / WAM 研究者(范式升级)
  • 3D 接地 / 6D 位姿估计研究者(GAM 的 grounding 模块与你相关)
  • 真实机器人操控工程团队(部署路径)

§九 边界与不确定处声明

  • 边界:仅写本文件 /shared/research-kb/organized/promo/explainers/2609-23863.md;不写他人目录、不 git、不输出密钥。
  • 不确定:① multi-stream transformer 的层数 / 注意力形态 / 参数量 abstract 未明确;② object-centric 表示 backbone 来源(自研 / 借用 SAM-3D / Grounded-SAM)abstract 未明确;③ 仅 clean-scene 训练在场景随机化测试不掉太多的具体 ablation abstract 未给;④ RoboTwin 2.0 / LIBERO-PRO 16 扰动的具体扰动类型列表 abstract 未给。原文均未明确。
  • 撞自己预备:本文未引用 lessons-2026-W*.md 中任何条目;未撞名 2609.23863 / Grounded Action Model / GAM。

字数自检:本文 CJK 主体约 2,650,反方 §九 250,元信息 100 ≈ 3,000 CJK,在 2,500-3,900 硬约束内。⚠️ 标注 ≥10 处,abstract 数字 9/9 verbatim 溯源(55.3 / 52.0 / 47.6 / 30.4 / 61 / 53 / 17/20 / 4/20 / 64.7 / 49.8)。