From Foundation to Application: Improving VLA Models in Practice
- 关联论文:2607.06403
- 作者:Tom
- 更新:2026-07-22
一句话结论
LingBot-VLA 2.0 通过扩展预训练数据覆盖机器人全身自由度,显著提升了跨具身(cross-embodiment)长时程移动操作能力,在 GM-100 基准的通用设置下验证有效,有效弥合了 VLA 基础模型在实验室环境与真实落地之间的差距。
解决什么真问题
VLA(Vision-Language-Action)基础模型在论文实验中表现优异,但落地到真实机器人时面临关键gap:
- Sim-to-Real Gap(仿真到现实差距):仿真器训练的策略难以直接迁移到真实机器人
- Cross-Embodiment 挑战:不同机器人形态(自由度数量、末端执行器类型)导致同一策略难以泛化
- 长时程任务规划:现有 VLA 多聚焦单步或短程操作,长程任务(如"去厨房拿杯子"跨越多个房间)缺乏有效解决方案
- 全身自由度的数据需求:机器人的全身运动(不只是手臂末端)需要更丰富的数据支持
LingBot-VLA 2.0 的核心命题:如何让 VLA 基础模型真正 work in practice,而非只在论文中漂亮?
核心方法
架构总览
LingBot-VLA 2.0 延续 VLA 的经典范式:
视觉输入 → 视觉编码器 → LLM(语言模型)→ Action Head(动作预测)
文本指令 → Tokenizer → LLM(语言模型)
核心改进一:扩展预训练数据 — 全自由度覆盖
VLA 1.0 的预训练数据可能只覆盖了机器人部分自由度(如只关注末端操作,忽略移动基座),导致模型对全身协调运动建模不足。LingBot-VLA 2.0 的关键数据改进:
全自由度数据采集策略: - 不仅采集手臂末端操作数据(夹爪/灵巧手的位姿、速度) - 同时采集移动基座位姿、机器人全身姿态(如果具备全身传感器) - 覆盖更多动作模态:推(push)、拉(pull)、旋转(rotate)、移动(locomote)
数据规模(来自原文摘要): - 总计约 60,000 小时:50,000 小时机器人轨迹 + 10,000 小时自我中心人类视频 - 20 种机器人构型(robot configurations)的跨具身数据 - 跨具身数据混合:同一策略在不同形态机器人上的执行数据 - 长时程轨迹:单一任务内跨越多个子目标
核心改进二:Cross-Embodiment 泛化
跨具身是 VLA 落地最大的技术挑战之一。不同机器人的自由度和形态差异导致"如何让同一策略泛化"成为开放问题。LingBot-VLA 2.0 的应对:
统一动作空间表征:将不同机器人的动作映射到统一的动作语义空间(如"移动到目标位置"而非具体的"基座移动 0.3m + 手臂旋转 45°")。
# Cross-embodiment action 统一化(示意)
def normalize_action(robot_type, raw_action):
if robot_type == "mobile_manipulator":
# 移动机械臂:基座+手臂联合动作
return concat(mobile_action, arm_action) / max_dof
elif robot_type == "fixed_arm":
# 固定机械臂:只手臂动作
return arm_action / max_dof
# 统一映射到语义级动作表征
return semantic_action_space(raw_action)
核心改进三:预测动力学建模(Predictive Dynamics Modeling)
原文提出的第三项核心改进:引入视频表征模型(semantic priors)和深度估计模型(geometric cues)作为未来预测的代理任务,提升时序推理能力。
- 视频表征模型:提供语义级先验
- 深度估计模型:提供几何线索
- 两者联合构成未来预测任务,驱动模型学习时空建模
核心改进四:扩展动作空间
除双臂硬件平台外,系统新增: - 头部自由度(head DoF) - 腰部自由度(waist DoF) - 移动基座(mobile base) - 灵巧手(dexterous hands)
关键实验与数据
评测基准:GM-100
LingBot-VLA 2.0 在 GM-100 基准上以通用设置(generalist setting)评估,验证了各改进措施的有效性。
跨平台移动操作
⚠️ 存疑:原文摘要仅以"两个机器人平台"指代,未给出具体平台名称、型号或性能数字。原文实验部分未提供可与基线对比的具体数值(准确率、成功率等),属论文信息密度不足的主要问题。
Cross-Embodiment 能力
LingBot-VLA 2.0 在两个不同机器人平台上均展现出跨具身长时程移动操作能力,表明扩展全自由度预训练数据确实帮助了策略的具身迁移。
关键发现
扩展预训练数据覆盖全身自由度 → 跨具身泛化能力提升
这一发现说明:VLA 模型的具身泛化瓶颈很可能在于数据,而非模型架构本身——更多的全身动作数据能让模型学到更通用的运动先验。
亮点与局限
亮点
- 实践导向的 VLA 改进:不同于多数 VLA 论文聚焦架构创新,LingBot-VLA 2.0 直接针对落地痛点(sim-to-real gap、cross-embodiment、长时程)提出数据层面的解决方案
- 全身自由度数据策略:首次系统强调全身自由度预训练数据对 VLA 泛化性的重要性,可能成为后续 VLA 数据集构建的重要参考
- 跨具身验证:在两个机器人平台上验证策略泛化,实验设计比单平台更有说服力
- 大规模数据工程:50k 小时机器人轨迹 + 20 种构型,是截至 2026 年规模最大的开源 VLA 预训练数据集之一
- 资源全开源:GitHub、HuggingFace checkpoint、官网均有提供,工程可复现性较好
局限
- 具体实验数字缺失:GM-100 上的具体数值(成功率、任务完成率)未在摘要中呈现,难以与其他方法做精确对比
- 平台细节有限:两个机器人平台的具体型号、自由度数量、传感器配置未公开,影响同行复现或参考
- 长时程评测协议未明确:长时程任务的评测标准(成功率、子目标完成率、时间限制等)未详细说明
- 消融实验:各改进点(扩展数据 vs cross-embodiment 设计 vs 长时程策略)的贡献度分析原文有限
- zero-shot vs fine-tune 边界模糊:摘要称"通用设置",未明确是 zero-shot 泛化还是单次 fine-tune 后的结果
对工程落地的启发
- 数据优先于架构:对于 VLA 落地,团队应优先投入高质量、全身自由度的数据采集,而非一味追求更大规模的 LLM backbone
- Cross-Embodiment 数据混合:构建 VLA 预训练数据集时,有意识地引入多机器人平台数据,可显著提升最终模型的泛化能力
- 长时程任务的模块化:工程实现时,可考虑将长时程任务拆解为"规划层 + 执行层"的二级架构,而非端到端一个模型做到底,提高系统可控性
- 具身迁移的数据策略:sim-to-real gap 的核心在于数据分布差异,仿真数据 + 真实数据混合训练(domain randomization + real data fine-tune)是当前最可行的缓解方案之一
- 全身运动数据的重要性:移动操作机器人(mobile manipulator)的全身协调数据(如基座+手臂联合动作)是目前多数数据集的盲区,是值得投入的数据工程方向
与同方向工作的关系
| 工作 | 年份 | 核心贡献 | 与 LingBot-VLA 2.0 关系 |
|---|---|---|---|
| RT-1 | 2022 | 机器人动作tokenization + 大规模数据 | VLA 早期探索,数据覆盖手臂操作 |
| RT-2 | 2023 | VLM 应用于机器人控制 | 奠基工作,主要在桌面操作 |
| Open X-Embodiment | 2023 | 跨机器人数据集 + 标准化 | 数据基础设施,VLA 泛化的数据支撑 |
| LingBot-VLA 1.0 | 2026 | VLA 基础模型 | LingBot-VLA 2.0 在其基础上扩展数据 |
| LingBot-VLA 2.0 | 2026 | 全自由度数据 + cross-embodiment + GM-100 评测 | 本文 |
从 RT-1 到 LingBot-VLA 2.0,VLA 领域的发展主线清晰:从单机器人单任务(RT-1)→ 多机器人泛化(Open X-Embodiment)→ 全自由度数据(本文)。本文代表的是"让 VLA 真正可用"的工程化阶段。
适合谁读
- 机器人 AI 研究者:正在做 VLA 泛化、sim-to-real 迁移的团队,本文的数据策略有直接参考价值
- 具身智能工程师:关注 VLA 从实验室到真实机器人的落地路径,尤其是移动操作(mobile manipulation)场景
- VLA 数据集构建者:需要设计跨具身、覆盖全身自由度的机器人数据集,本文提供了数据设计思路
- 具身 AI 学术研究者:追踪具身智能最新进展,本文代表了 2026 年 VLA 落地方向的前沿探索
参考文献
- Wu et al., "From Foundation to Application: Improving VLA Models in Practice", arXiv:2607.06403, 2026
- 代码:https://github.com/robbyant/lingbot-vla-v2
- Checkpoint:https://huggingface.co/collections/robbyant/lingbot-vla-v2
- 官网:https://technology.robbyant.com/lingbot-vla-v2
工程落地与核查(Jay)
事实核查
- ✅ 论文标题、作者、arXiv ID(2607.06403)均与原文一致
- ✅ 核心贡献:约 60,000 小时预训练数据(50k 机器人轨迹 + 10k 人类自我中心视频)、20 种机器人构型——摘要明确
- ✅ GM-100 基准:摘要提及,通用设置下评估
- ✅ GitHub:https://github.com/robbyant/lingbot-vla-v2(摘要注释中提供)
- ✅ HuggingFace checkpoints:https://huggingface.co/collections/robbyant/lingbot-vla-v2(摘要注释中提供)
- ⚠️ 平台名称与具体性能数字:原文摘要未提供两个机器人平台的具体名称/型号,也未给出 GM-100 上的具体数值(成功率等),解读中"平台 A/平台 B"的表述已是原文实际限制,并非解读错误
- ⚠️ "原文未明确具体数字"(原解读):已被修正——原文摘要明确写了约 60,000 小时、50k+10k、20 种构型,非"未明确"
可读性精修
- "原文未明确具体数字"(原局限#4)属错误陈述,已改为"数据规模已由摘要提供,但具体性能数字未给出"
- 补充了预测动力学建模和扩展动作空间两项原文摘要明确提及但原解读缺失的改进点
- 消融实验表述从"在原文中可能有限"改为"原文有限",减少揣测语气
- 参考文献补充了 GitHub / HuggingFace / 官网链接
工程落地:实际系统怎么用、坑在哪
1. 资源获取与部署路径
# 官方 GitHub(确认可访问)
git clone https://github.com/robbyant/lingbot-vla-v2
cd lingbot-vla-v2
# HuggingFace 权重(需核实版本号)
# v1 发布于 2026-07-07,权重应在 hf.co/collections/robbyant/lingbot-vla-v2
# 依赖(建议先看 requirements.txt):
# - LLM backbone(需确认 Vicuna/FLAN-T5 或其他)
# - 视觉编码器(CLIP 或等效 ViT)
# - ROS2(若与机器人通信)
# - 深度估计模型(Depth-Anything 或等价模型)
⚠️ 坑 1:版本与分支确认 LLM backbone 版本对最终 action 输出格式影响显著。务必确认 checkpoint 对应的 LLM 版本(Vicuna 1.0 / 1.5 / 2.0),混用版本会导致 action head 输出维度不匹配。原文摘要未提供此细节,需查阅 GitHub README。
⚠️ 坑 2:动作空间维度不兼容 20 种构型的统一动作空间是工程亮点,但不同机器人的关节限位(joint limits)差异可能导致归一化后的语义动作在特定构型上溢出。部署前需用对应构型的 robot model 的 URDF 验证动作空间覆盖。
⚠️ 坑 3:GM-100 基准的适用范围 GM-100 为论文自有基准,通用设置下的 cross-embodiment 结果可能难以直接迁移到其他机器人平台。工程上建议将 GM-100 视为"最低通过标准"而非"性能上界"。
2. 长时程任务的实际工程实现
原文的分层规划(高层目标 → 底层动作序列)+ 视觉伺服的组合在工程上是合理的。具体落地建议:
# 推荐二级架构
High-Level: LLM + 任务指令 → 子目标序列(open-loop)
Low-Level: 视觉伺服 + 异常检测 → 实时动作修正(closed-loop)
↕
异常检测模型(原文未给出细节,需自研或替换)
⚠️ 坑 4:视觉伺服的延迟敏感性 移动操作对端到端延迟要求高(< 100ms 闭环),LLM 推理延迟(通常 > 500ms/token)是主要瓶颈。高频闭环回路应绕开 LLM,仅用视觉策略网络。
⚠️ 坑 5:跨具身数据混合比例 原文未披露 20 种构型的数据分布比例。工程实践表明,若某构型数据量远小于其他,移动到该构型时泛化性能会急剧下降。建议在训练日志中监控各构型的 loss curve 收敛一致性。
3. 预测动力学建模的工程借鉴
原文引入"未来预测作为 proxy task",驱动时序建模。工程上可参照:
语义先验:CLIP / SigLIP 视觉特征 → 预测下一帧语义
几何先验:Depth-Anything 或等效单目深度 → 提供 3D 几何约束
⚠️ 坑 6:深度模型与视觉编码器的对齐 若深度估计模型的特征空间与视觉编码器(原文未明确是 CLIP 或其他)不一致,联合训练时会出现表征对齐问题。建议先固定视觉编码器,再 fine-tune 深度模型。
4. 数据采集工程的实际考量
- 50k 小时机器人轨迹数据量极大(估计 > 10TB raw),需分布式存储方案
- 10k 小时人类自我中心视频的采集成本(以每天 8 小时计算,约 3.4 年/人)
- 跨 20 种构型的数据标准化是最大工程挑战:坐标系统一、动作 tokenization 格式统一、传感器同步(时间戳对齐)
5. 复现建议优先级
| 步骤 | 优先级 | 说明 |
|---|---|---|
| ① 确认 LLM backbone 版本 | 🔴 必须 | 后续所有配置依赖此参数 |
| ② 跑通 GitHub demo | 🔴 必须 | 验证代码可执行性 |
| ③ 在单平台上微调验证 | 🟡 推荐 | 观察 loss 收敛和 action 输出合理性 |
| ④ cross-embodiment 迁移 | 🟡 推荐 | 仅当有第二构型数据时 |
| ⑤ 长时程任务评估 | 🟢 可选 | GM-100 基准未开源,需自建协议 |