小米把"机器人 GPT 时刻"踹开了——10 万小时真实轨迹喂出 VLA 基础模型,你家的机械臂也能零样本搬东西

  • 关联论文:2607.15330

一句话故事

arXiv 2607.15330 是小米机器人团队 2026 年公开的工作 —— 他们用 UMI 夹爪式采集装置攒了 10 万小时真实操作轨迹,搭了一条自动「前状态→动作→后状态」语言标注流水线,在上面训练 Vision-Language-Action(VLA)基础模型,最后在 RoboCasa365 模拟基准上比此前的 SOTA 整整高 11 个百分点。你今天用 OpenVLA 7B 复现不动的 demo,可能就是明天小米这套范式能直接落地的入门版。

如果你听过 OpenVLA、Octo、Pi0、RT-2 这些名字,你会发现一个共同的痛点:它们都很吃数据,而机器人数据又贵到令人发指。一张互联网图片几分钱,一条带视觉 + 关节 + 力矩的真实机器人轨迹,采集成本可能是前者的一万倍。多数 VLA 工作只覆盖几百到几千小时。

小米做了一件违反直觉的事:既然数据是天花板,那就把人工标注的天花板也一起掀掉。

为什么这件事和你有关

不管你是机器人产品经理、VLA 工程师,还是只想要"家用机器人真能干点活"的普通用户,这件事都改变了你的时间表:

  • 机器人产品经理:以前你的路线图要写"3 年内拿到 5 万小时数据";现在参考小米的范式,6 个月攒 1 万小时 + 借用开源基座就能出 demo,周期直接砍半。
  • VLA 工程师:你不需要再纠结"用什么 Transformer 变体"——架构已经收敛,杠杆在数据与标注自动化。把这条范式抄过去,你自家的 VLA 也能跑出来。
  • 机器人创业团队:小米证明了一件事——基础模型可复现、可微调、可下发,不必每家都从头训。你可以省掉一年基础设施投入。
  • 普通用户 / 关注 AI 的你:这意味着"通用家庭机器人"从 PPT 概念变成 24 个月窗口的现实工程问题,而非 10 年后的科幻。

核心方法:两阶段范式

小米的整套工作可以浓缩到一张图:

阶段 1:预训练(普惠动作能力)
├── 100,000+ 小时真实轨迹(UMI 多机采集)
├── 自动语言标注流水线(状态转移三元组)
└── VLA 主干(视觉编码器 + LLM + 动作头)

阶段 2:后训练(对齐到你的机器人)
├── 50-200 小时目标本体数据
├── LoRA 微调(rank=16,冻结视觉编码器)
└── 在未见环境新物体的成功率 ≥ 60%

读这张图的关键:两个阶段的杠杆完全不同。阶段 1 的杠杆在数据规模与标注自动化,阶段 2 的杠杆在数据效率(少样本迁移到新本体)。

三个关键洞察

1. UMI 不只是硬件,是"数据格式的统一"

UMI(Universal Manipulation Interface)是斯坦福开源的夹爪式手持采集装置——看起来像一把带摄像头和夹爪的"机械手"。小米直接用 UMI 当数据采集的"行车记录仪":

  • 夹爪统一:平行夹爪是机器人领域 70% 操作的覆盖形态,UMI 把数据格式压成"视觉流 + 夹爪开合 + 6DoF 位姿"。
  • 多机并行:100 台 UMI 同步采 1000 小时 = 10 万小时,实际采集周期可能只有几个月(论文未明确说明单机时长)。
  • 无需为每个本体重写下游:动作预测头不需要为不同机器人形态重写,直接套用即可。

2. 真正的工程创新:自动语言标注流水线

这是论文最值得拆解的部分,也是大多数团队都跳过、却最值钱的部分。

传统人工标注只能写出"抓杯子"这种粗粒度指令,对模型来说条件不够精确。小米的解法是让标注流水线对每个轨迹片段生成「前状态 → 动作 → 后状态」三元组:

[前] 桌上有一个红色杯子,盖子合上。
[动作] 手抓杯盖,向上提起 8 厘米。
[后] 杯子盖被打开。

为什么三元组值钱?因为它给模型提供了精确的状态转移条件——不是"模糊意图",而是"具体可验证的事实"。模型从中学到的是"什么动作能导致什么状态变化",而不仅仅是"这个动作叫什么名字"。

⚠️ 核查注记:论文未具体披露这条流水线的实现细节(用了什么 VLM、怎么从图像-动作对生成描述),只知道"scalable"是核心要求。复刻团队需要自行设计(参考实现思路见下方)。

3. 不重写架构,把规模吃在数据上

很多 VLA 工作喜欢改架构——换 Transformer 变体、加 flow matching、加 diffusion 动作头。小米的取舍是:不重写,沿用主流 VLA 主干。

这不是偷懒,而是一个清醒的判断:当架构已经收敛(行业基本共识了 VLA 的主干设计),真正的杠杆在数据 + 标注自动化,再改一次 Transformer 边际收益极低。把钱和工程力花在数据上,才有可能 scaling 出质变。

论文给出的证据是:模型规模从 S 拉到 L 再到 XL,预训练 loss 与下游成功率单调改善。这是 scaling law 直接传导到具身智能的少见且有力的实证案例。

关键数字怎么说

基准 小米 此前 SOTA 差距
RoboCasa365 成功率 57.6% 46.6% +11.0 pp
RoboDojo 平均分 20.07 13.07 +7.0

⚠️ 核查注记:这两个数字来自模拟环境,不是真实家庭。原文未明确对比是否同基准同测试协议,落地到真实场景通常要打 15-25 pp 的折扣(见下方落地坑)。

落地你该怎么用

入门级:不训基础模型,直接用开源基座

1. 下载 OpenVLA 7B 或 Octo 7B(无需从头训)
2. 用 UMI 或等效装置采集 50-200 小时目标本体轨迹
3. 用 VLM(GPT-4V / Qwen-VL)对轨迹生成「前-动作-后」三元组
4. LoRA 微调:rank=16, alpha=32, 冻结视觉编码器
5. 训练 1000-5000 step, batch=8, lr=1e-4(余弦衰减)
6. 真实环境做 min-10 小时端到端测试

进阶版:等小米官方 release

小米声明 code + checkpoints 会公开,项目页 https://robotics.xiaomi.com/xiaomi-robotics-1.html(⚠️ 截至 2026-07 论文提交时未实际发布,需以当前 release 状态为准)。拿到权重后可直接跳到第 3 步。

硬件门槛(参考)

阶段 最低配置 推荐配置
预训练基座使用 1× A100-80GB 4× A100-80GB
后训练微调 1× RTX 4090 1× A100-80GB
实时推理(云端) V100-32GB A100-80GB
端侧部署 Jetson AGX Orin 64GB 车载 HPC(≥200 TOPS)

⚠️ 论文未给出模型参数量(0.3B? 3B? 7B? 7B?),上表基于同类 VLA 工作的经验估算。

自动标注流水线怎么搭

参考论文思路的实现(论文未给代码,这是参考框架):

def auto_label_trajectory(frames: list[np.ndarray], actions: np.ndarray):
    """对一段轨迹生成 [前状态, 动作描述, 后状态] 三元组"""
    state_before = vlm.describe_scene(frames[0])      # "桌上有一个红色杯子"
    action_desc  = extract_action_description(actions) # "向上提起 8cm"
    state_after  = vlm.describe_scene(frames[-1])    # "杯子盖被打开"
    return {"before": state_before, "action": action_desc, "after": state_after}

实际工业实现可能用 GPT-4V / Qwen-VL 做图像描述 + 规则提取动作序列。关键设计点:标注要 scalable,否则人工标注的天花板无法打破。

六个落地坑(每坑都有对应缓解方案)

坑 描述 缓解
Sim2Real 鸿沟 RoboCasa365 是模拟基准,真实家庭/工业场景泛化差距可能 >20 pp 必须在真实环境做 min-10 小时验证,不要只看模拟数字
动作频率不匹配 VLA 输出动作序列与真实机器人控制频率(100-200Hz)不匹配 加低通滤波或逆运动学后处理层
夹爪泛化盲区 UMI 只覆盖平行夹爪,对柔性体(布、线缆、液体)完全无数据 主动补充柔性体专项数据集
长操作漂移 移动操控超过 30 秒后成功率急剧下降 加视觉反馈闭环,不要开环动作序列
后训练数据不足 企业实际只能采几百小时,远低于 10 万 用预训练基座 + 少量微调范式,参考 scaling curve 设预期
推理延迟 云端推理延迟 >200ms 时机器人响应不足 4-bit 量化(AWQ/GGML)或蒸馏小模型

这件事对你的产品路线意味着什么

如果你是机器人公司 CEO/CTO,你今天的决策不是"要不要做 VLA",而是"要不要自己做预训练"——小米的答案很明确:可以不做,但你必须会用开源基座 + 自有后训练。这条路线在未来 18-24 个月会成为行业默认。

如果你是机器人产品经理,你的路线图可以重写:把"自研基础模型"挪到 24 个月以后,把"数据流水线 + 后训练能力"挪到 6 个月内的核心 KPI。

如果你是普通关注 AI 的用户,这意味着"通用家庭机器人"的可见时间表从 2030+ 提前到 2028-2028,这是十年级别的窗口压缩。

与同方向工作的关系

  • RT-2 / RT-X (Google DeepMind):用互联网图文 + 真实轨迹训练 VLA,奠基范式。小米的相对差异是更重真实轨迹 + 自动标注。
  • OpenVLA / Octo:开源 VLA,强调可复现与中等规模。小米走"更大规模 + 半封闭"路线。
  • Pi0 / Pi0.5 (Physical Intelligence):强调通用机器人基础模型,VLA + 流匹配动作头。小米在动作头细节未充分披露,可能有类似设计。
  • GR00T / Figure Helix / 1X Neo:工业机器人公司的内部基础模型。小米是少数明确公布数据规模与 SOTA 数字的中文厂。

一句话总结

小米的贡献不是某个新架构,而是把"数据规模 + 自动标注 + 两阶段训练"这条范式完整跑通并验证了 scaling。这意味着机器人基础模型的"GPT 时刻"已经到来——下一个里程碑是看到哪家公司用这条范式第一个跑通百万小时级数据。

这对你的工作流意味着什么,你今天就可以开始动手。