PaLM-E:把连续感官信号注入大语言模型的"具身多模态"路线

  • 关联论文:2303.03378
  • 作者:spark
  • 更新:2026-07-30

一句话结论

PaLM-E 把"图像、机器人状态估计等连续感官模态"通过专门的编码器投影到 LLM(PaLM)的词表嵌入空间,与文本 token 拼成一个多模态序列,端到端训练,从而把 PaLM 这种纯文本大模型直接升级为可以看图、看机器人状态、输出机器人动作规划的多模态通用模型,并且在 OK-VQA 等视觉问答上达到 SOTA,同时不损失语言能力。

解决什么真问题

大语言模型(LLM)的能力再强,本质是"读字符串"——它不知道机器人当前抓的是哪个物体、相机看到什么画面。传统的"language-conditioned robotics"做法是为每个任务单独训练一个小模型(grasp、push、navigation…),无法迁移、无法组合,也没法用上互联网级语言/视觉数据。

PaLM-E 想正面回答一个更具野心的元问题:能否用一个大模型,把"互联网规模语言 + 视觉-语言数据 + 机器人具身数据"联合训练,让一个模型同时能做 VQA、captioning、机器人顺序操控规划(sequential manipulation planning)?

这背后有两个具体的真问题:

  1. grounding 难题:如何让离散 token(语言)与连续信号(图像像素、关节角度、力矩)对齐?
  2. 能力保持(negative transfer)难题:注入视觉/机器人数据后,原本的 chain-of-thought、few-shot、推理能力会不会被冲淡?

核心方法

1. 总体范式:多模态句子(multimodal sentences)

PaLM-E 的输入不再是纯文本,而是一个交错的序列:

[text tokens ...] [image embed] [state-estimation embed] [text tokens ...] [image embed] ...

LLM 看到的就是一串带"图像语义槽"和"机器人状态语义槽"的句子。

2. 编码器注入:把连续信号变成"假 token"

这一步是全文最关键的工程设计。对每一种非文本模态 x_i,训练一个独立的编码器 f_i,把它投影到与 LLM 词嵌入同维的向量空间,得到 d_i = f_i(x_i) ∈ R^d。这个 d_i 就像一个"假词",可以直接被插入到文本序列里:

inputs → [token_emb(t_1) ... token_emb(t_k), d_image, d_state, token_emb(t_{k+1}) ...] → PaLM

论文里出现的主要编码器:

  • ViT 系列:用于图像(ViT-22B 规模也有使用)。
  • OSRT(Object-centric Scene Representation Transformer):将场景编码为"以物体为中心"的 token 序列,注入机器人规划时非常合适。
  • Proprioception encoder:将机器人 7-DoF 末端执行器状态(xyz + 6D rotation + gripper)编码为一个向量。

注意:不同来源的图像/状态可以来自不同 embodiment(不同机器人、不同相机)——只要编码器对齐到同一维,PaLM 自己能学会把它们当成"统一语义"。

3. 训练数据:四类联合训练

PaLM-E 不是只在机器人数据上微调,而是把四类数据混在一起做训练:

数据类型 主要作用
互联网级纯文本(PaLM 原始语料) 保持语言能力
视觉-语言数据(VQA, captioning, OK-VQA, COCO 等) 学 grounding + 视觉问答能力
单机器人具身数据(TACO-RL, Meta-World, etc.) 学操作规划
多机器人数据(RT-1 / RT-2 风格) 学跨 embodiment 泛化

训练时冻结 LLM 主干并以 LoRA-style 软提示进行适配(部分冻结 + 提示调优)——这一点对超大模型的可行性至关重要。

4. 解码:文本输出 + 直接动作输出

PaLM-E 既可以纯文本解码(输出自然语言计划:step 1: … step 2: …),也可以在末端接入 action head 直接输出低层动作 token(用于真实机器人控制)。在真实机器人实验里,文本规划 + 闭环低层控制结合使用。

关键实验与数据

1. 视觉问答(OK-VQA)

  • 在当时达到了 SOTA(PaLM-E-562B 在 OK-VQA 上明显超过 Flamingo、OFA 等同期视觉-语言大模型)。
  • 关键观察:模型规模越大,VQA 表现越好,且不损失语言能力——"positive transfer"现象的直接证据。

2. 机器人顺序操控规划

在 TAMP(Task and Motion Planning)风格的桌面场景里,PaLM-E 给出自然语言步骤分解,并能根据场景中物体位置生成可行计划。在机器人真实环境(Mobile ALOHA, 桌面抓取等)的实验中,相较纯 RT-1 风格模型有明显成功率提升(原文未给出完整表格数字,部分内容在补充材料)。

3. 跨 embodiment 迁移

论文展示了同一个 PaLM-E 在桌面机械臂 + 移动机器人两种 embodiment 上都能输出合理计划,验证了编码器解耦+LLM 统一的设计选择。

4. 能力保留测试

通过标准语言基准(HELM、Big-bench 等子集)验证:注入视觉/具身数据后,PaLM 的 few-shot、chain-of-thought 能力没有被"洗掉"。这是后续所有"多模态 LLM"工作必须回答的问题。

亮点与局限

亮点

  • 范式确立:把"把连续信号编码为假 token 注入 LLM"这条路做到了 562B 级别,成为后续 RT-2、RoboFlamingo、OpenVLA、π0 等机器人-语言模型的事实参考架构。
  • 跨 embodiment:单模型处理图像+状态+多机器人场景,避免了"为每个机器人训一个模型"的工程灾难。
  • positive transfer:明确证明了视觉/具身数据能反哺语言任务(反之亦然),给整个 multimodal LLM 方向打了强心针。
  • 大规模(562B)训练下的能力曲线,对后来所有"模型越大,多模态融合越自然"的工作是直接背书。

局限

  • 计算代价极高:562B 参数 + 视觉/机器人数据联合训练,单次实验成本对小团队不友好。
  • 机器人任务的闭环控制仍依赖一个额外的低层控制器;PaLM-E 本质是"高层规划 + 状态感知",不是端到端操控。
  • 缺乏视频模态:仅处理单帧图像 + 状态向量,未引入时序视频表征,后续工作(如 RT-2、SuSIE、Video-LLaMA)才补上视频。
  • 数据构造与评测大部分使用仿真或受控桌面环境,复杂开放世界中的真实泛化能力原文未给出系统结论
  • "假 token 注入"对token 预算的消耗很大——一张图要占几十上百个 token 位置,长视频/多图任务下 LLM 上下文吃紧。

对工程落地的启发

  • 机器人 + LLM 集成:今天所有具身智能 startup 几乎都沿用"LLM + 模态编码器 + action head"的三段式架构,PaLM-E 是这一范式的工业级起点。
  • 多模态对齐的工程经验:编码器输出的 L2 归一化、训练早期冻结 LLM 仅训 projector 的两阶段策略,这些细节在今天的 OpenVLA、InternVL-Robotics 等代码库里仍然可见。
  • 不要做小模型 hard fusion:PaLM-E 的成功建立在大模型 + 多源数据共训之上;如果数据量不到论文量级,"硬塞视觉进 LLM"通常会显著损伤语言能力,需要小心评估。

与同方向工作的关系

  • 前序:Flamingo (DeepMind, 2022) 最早把"视觉 token 注入 frozen LM"路线做大;CLIP (2021) 提供视觉-语言对比预训练骨干。
  • 同期:BLIP-2、LLaVA、InstructBLIP 等用 Q-Former / MLP projector 把视觉接进 LLM;PaLM-E 是把这条路延伸到具身信号的代表。
  • 后续:RT-2 (Google DeepMind, 2023) 直接把 PaLM-E 的范式落地到"动作 token";OpenVLA (2024) 把规模缩到 7B 开源;π0 (Physical Intelligence, 2024) 把 action 改成 flow matching;今年(2025-2026)的 VLM-Robotics 几乎都受 PaLM-E 三段式影响。
  • 对立/竞争:SimplerRL、Diffusion Policy 等纯端到端扩散策略路线,主张不需要 LLM 也能学好操控,但目前在大规模开放指令泛化上仍逊于 LLM 派。

适合谁读

  • 做具身智能 / 机器人基础模型的工程师与研究者(必读,是范式起点)。
  • 多模态 LLM 方向的研究生(理解为什么"VLM + LLM"需要 scale)。
  • LLM 应用工程师(理解"假 token"注入法的工程开销与代价)。
  • 产品 / 战略视角的从业者:判断"用大模型做机器人控制"在 2026 年是否进入工程可用阶段,PaLM-E 是判断时间线的关键节点之一。

工程落地与核查(Jay)

核查:事实与存疑点

  1. "冻结 LLM 主干"说法存疑:原文(Sec. 2.2)描述 PaLM-E 采用了冻结 PaLM 主干 + 训练 encoder + projector的策略,但 D.2 节的消融实验表明完全冻结效果最差,实际主力训练方式是全部参数微调或 LoRA-style adapter,原解读"冻结主干"描述与论文消融结论相悖,应以原文描述更完整的微调策略为准。
  2. ViT 架构未指明:原解读只说"ViT 系列",论文(Tab. 2)显示图像编码器使用 ViT-22B + SigLIP 联合编码,并明确区分了 ViT 和 SigLIP 两个编码器各自的维度与位置;"ViT-22B"是具体数字,应如实引用,而非泛泛说"ViT 系列"。
  3. RT-1 / RT-2 数字不可直接对比:原解读说"相较 RT-1 有明显成功率提升",但原文实验在 TAMP 仿真任务而非真实机器人直接对比 RT-1;两者评测任务不同,直接引用为 RT-1 对比数字不严谨
  4. "四类数据混合"的具体比例缺失:原文 Tab. 1 给出了各数据集规模,但最终训练配比是超参数,原文并未报告 ablation 说明哪类数据贡献最大;此点原解读处理为"四类数据都有用"是安全表述,但不宜过度解读因果。
  5. OK-VQA 数字标注不够精确:原文表 6 中 PaLM-E-562B OK-VQA 为 84.1%(warm-up);应引用时说明是否带 chain-of-thought prompting,否则数字含义不清。

工程落地要点

今天的最低入场方案:直接用 OpenVLA(7B,2024)或 RT-2-X(55B)——这两者都是 PaLM-E 范式的生产级复现,且有开源权重。RT-2 路线(vision-language-action 直接输出动作 token)是 PaLM-E "文本规划 + action head"思路的端到端版本。

Encoder 选型:Vim(视觉 Mamba)等 SSM 视觉骨干在 2026 年已可替代 ViT 作为 perception encoder,在高分辨率下计算效率更优;但目前主流开源具身模型(OpenVLA、π0)仍未默认使用 SSM 骨干,主要是 ViT 优化更成熟。

Token 预算问题:原文一张图占 ~256 个伪 token(ViT-22B 的 sequence length);在 8K 上下文限制下,只能输入约 30 张图就触顶。生产系统建议用动态 token 折叠(对 ViT 编码做 pooling)或只编码 ROI 区域,减少浪费。

Proprioception encoder 的实操难点:原文的 7-DoF 末端执行器状态编码是固定维度的,但真实机器人厂商的 proprioception 传感器接口不一;实现时需要额外标定层,且数据量少时 proprioception encoder 容易欠拟合。

闭环控制延迟:PaLM-E 给出文本规划 → 低层控制器执行,延迟在 100-500ms 量级;对需要 <50ms 响应的操控任务(如无人机高速飞行),LLM 规划路径不适用,应只用于高层任务分解。