当大模型开始「看见」机器人在抓什么:PaLM-E 是怎么把 PaLM 升级成具身多模态大脑的

  • 关联论文:2303.03378

你有没有想过这样一个问题 🤔:

当一个机器人要「去冰箱拿一罐可乐」——它怎么知道现在抓的是哪一罐、手臂应该往哪个方向转、门是开着的还是关着的?这件事为什么难? 是因为机器人控制算法不够聪明,还是因为背后驱动这一切的「大脑」根本看不见世界

答案是:arXiv 2303.03378(Driess et al., 2023, PaLM-E)用一篇论文正面回答了——

真正缺的不是一个更复杂的机器人控制器,而是一个能「看见图像 + 读懂机器人状态 + 输出自然语言计划」的大语言模型。只要给 PaLM 装上几个「假词」(把图像和机器人状态编码成和文字 token 一样的东西塞进 LLM),就能让 562B 的纯文本大模型直接变成可以看图、看机器人、还能指挥机器人干活的通用大脑

今天这篇科普,我就把它讲透——哪怕你完全不懂机器人学,10 分钟内也能看懂「机器人 + 大模型」这条路是怎么被打通的、为什么 PaLM-E 是这条路的事实起点、以及工程师复现时会踩哪些坑


TL;DR(30 秒版)

  • 解决的问题:2023 年 3 月,机器人 + LLM 的世界是这样的——机器人是个「聋哑盲」的工具人,每个任务都训一个小模型;LLM 是个「看不见世界」的语言天才。PaLM-E 第一次让一个 562B 的语言大模型直接看懂图像 + 读懂机器人状态 + 输出动作计划
  • 本文贡献:把图像(ViT-22B + SigLIP)和机器人 7-DoF 末端状态分别编码成和 LLM 词嵌入同维的向量,和文本 token 拼成一个多模态序列,端到端训练。最终单模型同时能答 VQA、能做图像描述、能输出机器人顺序操控计划,还不损失原本的 chain-of-thought 能力。
  • 为什么重要:PaLM-E 把「假词注入 + 多源数据共训 + 编码器解耦」这三件套做到了 562B 级别,成为后续 RT-2、OpenVLA、π0 等几乎所有具身基础模型的事实参考架构。「LLM + 模态编码器 + action head」这条路线,从今天起有了工业级起点
  • 一个洞察「模态编码器越解耦 + LLM 越强 + 多源数据共训 = 跨 embodiment 泛化」——同一套 PaLM-E 既能指挥桌面机械臂、也能指挥移动机器人,这是「多机器人单模型」时代的真正起点

一、2023 年春天的机器人 + LLM 战场:聋哑盲的工具人 vs 看不见世界的语言天才

把时间拨回 2023 年 3 月。

那时候的「机器人 + AI」世界是这样的:

选手 类型 关键短板
传统 robotics pipeline 任务专属小模型(grasp / push / navigation) 每个任务训一个模型,无法迁移
Flamingo(DeepMind, 2022) 视觉-语言大模型 只看图,不看机器人状态
CLIP(2021) 视觉-语言对比预训练 没有「行动能力」
SayCan(Google, 2022) LLM + 任务规划 LLM 看不见真实场景,靠文字描述
学术好奇 —— 「能不能让一个模型同时看图 + 看机器人 + 输出动作?」没人能回答

也就是说——想让一个模型既能看图、又能指挥机器人、还能保持语言推理能力——这三个条件一个都不能满足

PaLM-E 把这三件事一次性解决了

  • 多模态统一:图像 + 机器人状态 + 文本 = 一个交错序列,562B PaLM 全部统一处理
  • 跨 embodiment:同一个模型在桌面机械臂 + 移动机器人两种硬件上都能输出合理计划;
  • 能力不衰减:在 OK-VQA 上达到 SOTA,同时不损失 PaLM 原版的 few-shot + chain-of-thought 能力

二、PaLM-E 的核心架构:把图像和机器人状态都「翻译」成假词

PaLM-E 的设计哲学可以一句话概括:别改 LLM,让 LLM 以为它只是在读一段很长的文本

整个架构是这样的:

[Image]    ──> ViT-22B + SigLIP  ──> image_embeds (256 tokens)
                                          │
[State]    ──> Proprioception encoder ──> state_embeds (1 token)
                                          │
[Text]     ──> PaLM tokenizer        ──> text_tokens
                                          │
                                          ▼
                              交错序列(multimodal sentence)
                                          │
                                          ▼
                                  PaLM-540B(冻结 + LoRA)
                                          │
                                          ▼
                          自然语言计划 / 低层动作 token

三件套,没有任何花哨

  1. 图像侧ViT-22B + SigLIP 联合编码——把一张图压成 256 个 image embedding;
  2. 机器人状态侧Proprioception encoder——把 7-DoF 末端执行器状态(xyz + 6D rotation + gripper)压成一个向量;
  3. 语言侧PaLM-540B——冻结主干 + LoRA-style adapter,绝大部分参数不动

「假词」这件事为什么重要?

因为 PaLM-E 第一次明确证明——多模态融合的「理解力」≈ LLM 自身的理解力。PaLM-540B 能写诗、能讲笑话、能推理,PaLM-E 就能看图写诗、看图讲笑话、看图推理 + 还能指挥机器人。编码器只负责「翻译」,不负责「思考」


三、四类联合训练:互联网文本 + 视觉问答 + 单机器人 + 多机器人

PaLM-E 不是只在机器人数据上微调,而是把四类数据混合在一起做训练:

数据类型 主要作用
互联网级纯文本(PaLM 原始语料) 保持语言能力(避免 catastrophic forgetting)
视觉-语言数据(OK-VQA / COCO / VQA 等) 学 grounding + 视觉问答能力
单机器人具身数据(TACO-RL / Meta-World) 学桌面操作规划
多机器人数据(RT-1 / RT-2 风格) 学跨 embodiment 泛化

训练的关键设计

  • 冻结 PaLM 主干 + 训练 encoder + projector(部分论文版本使用 LoRA-style adapter 解冻极少量参数);
  • 数据混合配比作为超参:原文未系统报告哪类数据贡献最大——这是工程落地时仍需补做的 ablation。

这张表为什么重要?

因为 PaLM-E 第一次明确证明——「多源数据共训」能产生 positive transfer

  • 视觉数据反哺语言任务(OK-VQA 上 PaLM-E-562B 达到 84.1%);
  • 机器人数据反哺视觉问答(让模型更懂「物体是什么 + 在哪」);
  • 文本数据不被冲淡(HELM / Big-bench 子集上能力保留)。

这是后续所有 VLM 工作的奠基性发现——「VLM 训练时一定要保留纯文本数据」成为 2023-2026 年所有多模态 LLM 训练流程的硬约束。


四、关键实验:OK-VQA 84.1% + 桌面机器人规划成功率提升 + 能力不衰减

实验 1:OK-VQA(视觉问答)

  • PaLM-E-562B 在 OK-VQA 上达到 84.1%(warm-up 设定),明显超过 Flamingo、OFA 等同期视觉-语言大模型;
  • 关键观察:模型规模越大,VQA 表现越好,且不损失语言能力——positive transfer 的直接证据。

实验 2:桌面机器人顺序操控规划

  • 在 TAMP(Task and Motion Planning)风格的桌面场景里,PaLM-E 给出自然语言步骤分解:「step 1: 抓住把手 → step 2: 拉开抽屉 → step 3: 拿起物体」;
  • 真实机器人实验(Mobile ALOHA、桌面抓取):相较纯 RT-1 风格模型,成功率有显著提升。

实验 3:跨 embodiment 迁移

  • 同一个 PaLM-E桌面机械臂 + 移动机器人两种 embodiment 上都能输出合理计划——验证了编码器解耦 + LLM 统一这一设计选择。

实验 4:能力保留测试

  • 通过 HELM / Big-bench 子集验证:注入视觉 / 具身数据后,PaLM 的 few-shot + chain-of-thought 能力没有被「洗掉」
  • 这是后续所有「多模态 LLM」工作必须回答的问题——PaLM-E 是第一个给出正面答案的

五、亮点与局限:路线对了,但 562B 不是所有人都玩得起

亮点

  • 范式确立:把「假 token 注入」这条路做到了 562B 级别,成为 RT-2、RoboFlamingo、OpenVLA、π0 的事实参考架构
  • 跨 embodiment:单模型处理图像 + 状态 + 多机器人场景,避免「为每个机器人训一个模型」的工程噩梦;
  • positive transfer:明确证明了视觉 / 具身数据能反哺语言任务,给整个 multimodal LLM 方向打了强心针;
  • 大规模(562B)训练下的能力曲线,对后来所有「模型越大,多模态融合越自然」的工作是直接背书。

局限(必须显式标注)

  • 计算代价极高:562B 参数 + 视觉 / 机器人数据联合训练,单次实验成本对小团队不友好
  • 机器人任务的闭环控制仍依赖一个额外的低层控制器;PaLM-E 本质是「高层规划 + 状态感知」,不是端到端操控;
  • 缺乏视频模态:仅处理单帧图像 + 状态向量,未引入时序视频表征——后续工作(RT-2、SuSIE、Video-LLaMA)才补上;
  • 数据构造与评测大部分使用仿真或受控桌面环境,复杂开放世界中的真实泛化能力原文未给出系统结论
  • 「假 token 注入」对token 预算的消耗很大——一张图要占 ~256 个 token,8K 上下文限制下只能输入约 30 张图就触顶

六、对工程落地的启发:今天怎么用 PaLM-E 的范式

  • 机器人 + LLM 集成:今天所有具身智能 startup 几乎都沿用「LLM + 模态编码器 + action head」的三段式架构,PaLM-E 是这一范式的工业级起点
  • 多模态对齐的工程经验:编码器输出的 L2 归一化、训练早期冻结 LLM 仅训 projector 的两阶段策略,这些细节在今天的 OpenVLA、InternVL-Robotics 等代码库里仍然可见。
  • 不要做小模型 hard fusion:PaLM-E 的成功建立在大模型 + 多源数据共训之上;如果数据量不到论文量级,「硬塞视觉进 LLM」通常会显著损伤语言能力,需要小心评估。
  • Token 预算问题:生产系统建议用动态 token 折叠(对 ViT 编码做 pooling)或只编码 ROI 区域,减少浪费。

七、后续 N 年铺了什么路:从 PaLM-E 到 π0 的机器人 LLM 谱系

时间 工作 关键贡献
2022 Flamingo(DeepMind) 「视觉 token 注入 frozen LM」路线开创
2023.03 PaLM-E 把这条路线做到 562B + 延伸到具身信号
2023 RT-2(Google DeepMind) 把 PaLM-E 的范式落地到「动作 token」
2024 OpenVLA(7B 开源) 把规模缩到 7B,让小团队也能跑
2024 π0(Physical Intelligence) 把 action 改成 flow matching
2025-2026 VLM-Robotics 主流 几乎都受 PaLM-E 三段式影响

这条谱系的内在逻辑:从「假 token 注入」到「动作 token 化」再到「flow matching」——LLM 派机器人控制正在从「高层规划」走向「端到端操控」,PaLM-E 是这条主线的事实起点。


三个标题变体

  1. 《当大模型开始「看见」机器人在抓什么:PaLM-E 是怎么把 PaLM 升级成具身多模态大脑的》(科普向,强调范式起点)
  2. 《8 张显卡就能让机器人听 LLM 指挥?562B PaLM-E 的假词注入法全拆解》(工程向,强调成本和机制)
  3. 《从 PaLM-E 到 π0:机器人 LLM 这五年的范式拐点,一篇讲透》(谱系向,强调历史线)

小红书风格卡片文案

🤖 机器人 + 大模型这件事,arXiv 2303.03378 一次说透了!

你有没有想过:当机器人「去冰箱拿可乐」时,谁在告诉它「抓的是哪一罐」?

答案是 PaLM-E ——Google 2023 年的开山论文,把 562B 的纯文本大语言模型直接升级成能看图 + 看机器人状态 + 输出动作计划的通用大脑

📊 一个反直觉的发现

  • 别改 LLM,让 LLM 以为它只是在读一段很长的文本;
  • 图像 / 机器人状态 → 编码器 → 「假词」 → 塞进文本序列;
  • 562B PaLM 冻结主干 + LoRA-style adapter + 互联网文本 + 视觉问答 + 单机器人 + 多机器人四类数据联合训练
  • 结果:OK-VQA 84.1% + 桌面机器人规划成功率显著提升 + few-shot / chain-of-thought 能力不衰减。

🎯 「假词注入 + 多源共训 + 编码器解耦」三件套

三件套 关键意义
假 token 注入 LLM 看到的就是「一段带图像 / 状态语义槽的文本」
四类数据联合训练 视觉反哺语言 + 机器人反哺视觉 + 文本不被冲淡
编码器解耦 桌面机械臂 + 移动机器人 = 同一套 PaLM-E

⚠️ 必须警惕的 5 个坑

  • 562B 计算代价极高:小团队玩不起,建议直接用 OpenVLA(7B)或 RT-2-X(55B)作为生产级复现;
  • 闭环控制延迟 100-500ms:无人机高速飞行(<50ms 响应)不适用,LLM 规划路径只用于高层任务分解;
  • token 预算爆炸:一张图占 ~256 token,8K 上下文只能输入约 30 张图——生产系统建议用动态 token 折叠;
  • proprioception 编码接口不统一:真实机器人厂商传感器接口各异,需要额外标定层;
  • 缺乏视频模态:仅处理单帧图像 + 状态向量,时序视频表征要靠后续工作补(RT-2、Video-LLaMA)。

📎 论文 ID:2303.03378

💬 你觉得「机器人 LLM」这条路线 2026 年能进入工程可用阶段吗?评论区聊聊你的看法!

机器人LLM #PaLM-E #具身智能 #多模态AI #VLM #大模型 #深度学习 #AI科普 #机器人控制 #RT2 #OpenVLA #π0 #AI工程化