Xiaomi-Robotics-1:基于 10 万小时真实轨迹的 VLA 基础模型
- 关联论文:2607.15330
- 作者:flyP
- 更新:2026-07-20
一句话结论
小米机器人团队用 10 万小时真实操作轨迹 + UMI 采集装置 + 自动语言标注流水线 训练了一个通用 Vision-Language-Action(VLA)基础模型,在未见环境中可零样本执行移动操控指令,并用极少数据就能微调到新任务。
解决什么真问题
通用机器人目前有三个长期痛点:
- 数据规模:互联网级数据对机器人不适用,真实轨迹采集贵、慢、稀缺。多数 VLA 工作只覆盖几百到几千小时。
- 语言落地:标注员写不出机器人真实执行的细粒度语义。粗粒度的「抓杯子」不足以教模型状态转移。
- 跨本体泛化:机器人形态各异,从桌面臂到移动底盘,单一策略难以兼容。
Xiaomi-Robotics-1 把这三个问题拆成两个训练阶段:预训练(学通用动作生成)+ 后训练(对齐到具体本体和人类自然指令)。设计目标是:先在海量异构数据上把动作生成能力撑起来,再用小数据适配到任意下游。
核心方法
1. 数据:UMI 设备 + 10 万小时轨迹
UMI(Universal Manipulation Interface)是手持夹爪式采集装置,将人类示范压缩成统一的视觉-动作流。多机并行采集保证数据规模;同时 UMI 输出的轨迹格式相对规整,下游动作预测头不需要为每个机器人本体重写。
论文指出 100k+ 小时是「多机 + 长周期 + 异构任务」的累积(原文未明确每台 UMI 多少小时/天)。
2. 自动语言标注流水线(核心创新)
最值得工程圈关注的一点:训练用的语言标注不是人写的,是自动标注的。流水线对轨迹片段做场景状态转移描述(state transition),例如:
[片段前] 桌上有一个红色杯子,盖子合上。
[动作] 手抓杯盖,向上提起 8cm。
[片段后] 杯子盖被打开。
这种「前状态 → 动作 → 后状态」的三元组比单步指令稠密得多,给模型提供了精确条件而非模糊意图。论文强调这套流水线要 scalable,否则人工标注是天花板。
3. 两阶段训练
- 预训练(Pre-training):在 100k+ 小时自动标注轨迹上训练 VLA 主干,目标是从 (图像, 语言状态描述) 预测下一段动作序列。重点验证 scaling law —— 数据量、模型参数量越大,零样本性能越好。
- 后训练(Post-training):在小规模、人类真实指令的目标本体数据上微调,把预训练学到的通用动作分布对齐到特定机器人的执行空间(如底盘 + 机械臂的移动操控)。
4. 关键设计取舍
- 不重写架构,沿用主流 VLA 主干(视觉编码器 + 语言模型 + 动作解码器),把规模吃在数据与算力上。
- 冻结 backbone 不预训练语言能力:复用已有 LLM/VLM 的语义理解,主要新增的是动作头与轨迹对齐机制。
- 零样本 + 微调双轨:既能直接用,也能继续调,避免「一次性」模型。
关键实验与数据
论文报告了三组核心数字:
| 基准 | Xiaomi-Robotics-1 | 此前 SOTA | 提升 |
|---|---|---|---|
| RoboCasa365 成功率 | 57.6% | 46.6% | +11.0pp |
| RoboDojo 平均分 | 20.07 | 13.07 | +7.0 |
| 模拟基准综合 | 显著领先 | — | — |
具体含义:
- RoboCasa365:长尾厨房操控任务套件,看模型在新环境新物体上的泛化能力。+11pp 是非常显著的绝对值。
- RoboDojo:连续控制 + 长视野决策的测试,强调双臂/灵巧操作的复合能力。
- 论文还报告了 scaling curve:模型规模从 S 拉到 L 再到 XL,预训练 loss 与下游成功率单调改善。后训练时,预训练越强的底座,少量微调后的零样本迁移越好——这是 scaling law 直接传导到下游的少见且有力的证据。
亮点与局限
亮点
- 真实数据规模:10 万小时真实轨迹在公开 VLA 工作里是第一梯队(同期典型工作在 1k–10k 小时)。
- 可扩展标注流水线:把数据成本从「人力」转成「算力」,可重复使用。
- 两阶段范式:把「通用动作能力」与「本体对齐」解耦,工程上复用度高。
- 明确的 scaling 验证:不是单纯堆数,而是论文展示 loss 与下游指标都在涨。
- 承诺开源:声明 code + checkpoints 公开(项目页:robotics.xiaomi.com/xiaomi-robotics-1.html)。
局限
- 数据偏差未量化:UMI 是手持夹爪型采集,对「双手协作」「柔性物体」的覆盖度原文未明确。
- 跨本体泛化的边界:在桌面臂上的实验很多,移动底盘 + 长视野任务的失败模式未充分披露。
- 安全性与失败恢复:在真实家庭环境里,模型错了之后怎么自救、是否有人介入机制,论文未深入。
- 推理延迟与算力:10 亿参数级 VLA 的部署成本未列出,未给端侧运行参考。
- 评测基准以模拟为主:真实家庭、真实工业线的现场数据有限。
对工程落地的启发
- 数据 > 架构:当架构已经收敛(VLA 主干已成共识),真正的杠杆是数据 + 标注自动化。投入一条可扩展的标注流水线比再改一次 Transformer 划算。
- 状态转移标注 > 单步指令:做机器人视频/轨迹训练时,标注「前-动作-后」三元组比单纯写命令更值钱。
- 两阶段部署:在企业里完全可以借鉴——先用云端基础模型服务多种机器人硬件,再用本地少样本微调对齐产线特有动作。
- 采集装置标准化:UMI 这种夹爪级采集装置把数据格式统一了,相当于机器人领域的「行车记录仪」,对中小团队尤其友好。
- scaling 评估要做:不要只看最终指标,要画 loss vs data、loss vs model size 的曲线,否则规模化决策没依据。
与同方向工作的关系
- RT-2 / RT-X (Google DeepMind):用互联网级图文数据 + 真实轨迹训练 VLA,奠定范式。Xiaomi 的相对差异是更专注重真实轨迹与自动标注。
- OpenVLA / Octo:开源 VLA,强调可复现与中等规模。Xiaomi 走「更大规模 + 半封闭」路线。
- Pi0 / Pi0.5 (Physical Intelligence):强调通用机器人基础模型,VLA + 流匹配动作头。Xiaomi 在动作头细节上未充分披露,可能有类似设计。
- UMI 系列 (Stanford / Toyota):Xiaomi 直接受益于 UMI 硬件设计的开放,是其生态扩展。
- GR00T / Figure Helix / 1X Neo:工业机器人公司的内部基础模型。Xiaomi 是少数明确公布数据规模与 SOTA 数字的中文厂。
适合谁读
- 机器人基础模型研究者:必读,scaling 验证 + 数据流水线。
- VLA 工程师:重点看两阶段范式与自动标注,可直接复用思路。
- 数据集/标注团队:状态转移标注流水线的设计要点值得拆解。
- 机器人产品/创业团队:判断自家 VLA 路线与小米路线的差距时使用。
- 对 scaling law 感兴趣的研究者:难得的「具身 scaling law」实证案例。
工程落地与核查(Jay)
⚠️ 事实核查
- "10 万小时":原文明确数字,但未说明是单臂累计还是多机并行总时长。若是多机并行(如 100 台 UMI 同步采集 1000 小时),实际数据收集周期可能只有数月,不代表真实世界数据稀缺性被根本解决。
- 57.6% / 20.07 数字:这两个数字来自模拟基准(RoboCasa365 / RoboDojo),原文以此声称"显著领先 SOTA",但原文未提供对应 SOTA 模型的同基准精确数字(仅引用"此前 SOTA 46.6% / 13.07"),需核实这组 SOTA 数字是否为同基准同测试协议的公平对比。
- "承诺开源":项目页 robotics.xiaomi.com 在 2026-07 论文提交时未公开代码/权重(需核实当前状态)。开源承诺 ≠ 开源已交付,需以实际 release 为准。
- "自动语言标注流水线":这是本文的核心工程贡献,但具体方法(如何从图像-动作对生成状态转移描述、是否用了 VLM/机器人视觉模型辅助)原文未披露,无法独立复现。
- "零样本 + 微调双轨":原文未说明零样本迁移具体在哪些任务上测得、成功率多少;后训练微调所需数据量也未量化。
工程落地路径
当前可直接用的资源: - 项目页 https://robotics.xiaomi.com/xiaomi-robotics-1.html(代码/权重待验证是否已发布) - 论文方法描述(预训练 + 后训练框架可参考,但自动标注流水线不可直接复用) - UMI 数据采集装置(需自行购买或复刻,Stanford UMI 硬件已开源)
落地硬件门槛:
| 阶段 | 最低配置 | 推荐配置 |
|---|---|---|
| 预训练推理(基座使用) | 1×A100-80GB | 4×A100-80GB(batch 并行) |
| 后训练微调 | 1×RTX 4090(24GB)或同级别 | 1×A100-80GB |
| 实时推理(云端) | V100-32GB 或更好 | A100-80GB |
| 端侧部署 | Jetson AGX Orin(64GB)或更新 | 车载 HPC(≥ 200 TOPS) |
⚠️ 论文未给出模型参数量(0.3B? 3B? 7B?),上表基于同类 VLA 工作的经验估算。
两阶段落地实战流程:
阶段1:预训练基座选型
├── 直接用开源 VLA 基座(OpenVLA 7B / Octo 7B)跳过预训练
├── 或等 Xiaomi 官方 release 后使用其基座
└── 验证:基座在目标场景的零样本成功率(<30% 通常需后训练)
阶段2:后训练微调(企业适配)
├── 数据采集:用 UMI 或等效装置采集 50-200 小时目标本体轨迹
├── 自动标注:用 VLM 对轨迹片段生成「前-动作-后」三元组(参考论文思路)
├── 微调策略:LoRA(rank=16, alpha=32)+ 冻结视觉编码器
│ └── 训练 1000-5000 step,batch=8,lr=1e-4(余弦衰减)
└── 验证:在未见目标场景数据上的成功率 ≥ 60%(基线参考)
常见坑:
| 坑 | 描述 | 对策 |
|---|---|---|
| 模拟-现实迁移(Sim2Real gap) | RoboCasa365 是模拟基准,真实家庭/工业场景泛化差距可能 >20pp | 必须在真实环境做 min-10 小时验证,不要只看模拟数字 |
| 动作频率不匹配 | VLA 输出的动作序列与真实机器人控制频率(100-200Hz)不匹配 | 需要低通滤波或逆运动学后处理层 |
| 夹爪泛化盲区 | UMI 采集只覆盖「平行夹爪」操作,对柔性体(布、线缆、液体)完全无数据 | 主动补充柔性体专项数据集 |
| 长时间操作漂移 | 移动操控(底盘移动 + 臂操作)超过 30 秒后成功率急剧下降 | 加入视觉反馈闭环,而非开环动作序列 |
| 后训练数据不足 | 企业实际能采集的轨迹往往只有几百小时,远低于 10 万 | 用预训练基座 + 少量微调的范式,参考原文 scaling law 曲线设定预期 |
| 推理延迟 | 云端推理延迟 >200ms 时机器人响应不足 | 考虑 4-bit 量化(AWQ/GGML)或蒸馏小模型 |
自动标注流水线参考实现:
# 状态转移三元组自动标注(参考论文思路,未知原文具体实现)
def auto_label_trajectory(frames: list[np.ndarray], actions: np.ndarray):
"""对一段轨迹生成 [前状态, 动作描述, 后状态] 三元组。
实际实现可能用 VLM(如 GPT-4V/Qwen-VL)做图像描述 + 规则动作提取。
"""
state_before = vlm.describe_scene(frames[0]) # "桌上有一个红色杯子"
action_desc = extract_action_description(actions) # "向上提起 8cm"
state_after = vlm.describe_scene(frames[-1]) # "杯子盖被打开"
return {
"before": state_before,
"action": action_desc,
"after": state_after
}
评测建议: - 不要只看论文报告的模拟基准数字;落地前必须用真实机器人做 最少 10 小时轨迹的端到端测试 - 移动操控(底盘 + 臂协同)的成功率通常比论文数字低 15-25pp - 重点测"新环境 + 新物体"组合(in-distribution 成功率无参考价值)