TANGO:用全身视觉-语言-动作模型,让类人机器人在杂乱室内场景穿行

  • 关联论文:2609.09158
  • 作者:flyP
  • 更新:2026-09-09

一句话结论

TANGO 是首个把语言条件下的类人机器人杂乱环境导航建模为「全身视觉-语言-动作」联合决策的端到端框架:给定自然语言指令和第一人称 RGB,直接预测 29 自由度关节空间动作,由下游全身控制器执行;在仿真里以 SOTA 跑通视觉-语言导航,并在零样本实机(Unitree G1)上完成杂乱场景穿越。

解决的真问题

传统视觉-语言导航(VLN)研究把问题抽象成 2D 路径规划:智能体在离散图上选下一个可见节点,或在可通行区域里做 2D 轨迹预测。但类人机器人在真实杂乱环境里穿行不是 2D 行走——它必须同时协调:

  • 手臂摆放:侧身、抬臂、抱胸、防撞;
  • 躯干姿态:弯腰、低头、侧倾以适配低矮通道;
  • 步态调制:跨步、碎步、抬腿高度,避免踢到桌脚、椅腿、玩具。

把这些当成高层指令再交给低层全身控制器,会面临 sim2real gap 和「高层语义到关节轨迹」的二段误差。TANGO 的核心主张是:把全身动作作为 VLA 模型的直接输出,让高层语义决策和底层几何避障在同一个策略里联合优化。

核心方法

整体架构

TANGO 的输入是自然语言指令 $l$ 和第一人称 RGB 观测序列 $o_{1:t}$,输出是 29 自由度关节空间动作 $a_t \in \mathbb{R}^{29}$,交给下游全身控制器执行。

29 自由度对应 Unitree G1 的完整身体配置——腿、躯干、双臂、头——所有关节都被显式建模。这意味着 TANGO 不是输出「前进 0.3m 并左转」这种抽象指令,而是直接给出每一时刻每个关节的目标角或目标增量,由低层控制器负责跟踪。

仿真训练数据合成流水线

由于真实世界难以大量采集「杂乱场景 + 类人全身动作 + 语言标注」三元组,论文完全在仿真里构造训练数据。流水线分四步:

  1. 全局路径规划:用传统规划器在场景地图上生成从起点到语言指令目标点的无碰撞 2D 路径;
  2. 全身运动生成:基于该路径用运动学 IK / 全身运动生成器合成初始全身动作序列,保证物理可达;
  3. 障碍感知动作编辑:对生成的动作做局部编辑,让手臂、躯干主动避让近距离障碍(不只是脚步避障);
  4. RL 跟踪:用强化学习训练一个跟踪器,把「参考全身动作」当成可被扰动的目标,训练出能容忍动力学扰动和环境变化的稳定跟踪策略。

最终输出是「动态可行的全身动作监督信号」——关节角连续、时序平滑、几何避障正确,可以直接喂给 VLA 模型做行为克隆。

VLA 模型本体

TANGO 用一个 VLA Transformer 把语言指令和视觉 token 序列融合后,回归出 29 维动作。论文没有给出精确 backbone 细节,但训练目标就是标准的 next-action / next-token 预测在连续动作空间上的对应形式(原文未明确具体是扩散策略还是回归式策略,从论文没有强调 diffusion 反向过程来看,更可能是回归式 actor)。

下游全身控制

29-DoF 动作直接交给已有的全身跟踪控制器(训练流水线里的 RL 跟踪器在实机端复用),形成「高层语义策略 → 关节目标 → 低层跟踪」的闭环。

关键实验与数据

  • 仿真 SOTA:在多个视觉-语言导航基准上达到 SOTA,并且在需要绕障的困难场景上显著超过强模块化基线——后者通常把规划和全身控制分开训练;
  • 实机零样本:把仿真训练的策略直接部署到 Unitree G1,没有使用任何真实导航数据做微调,依然能在杂乱真实场景中按语言指令稳健穿行;
  • 29-DoF 全身体节直接预测:相比仅输出底盘速度的策略,显著降低「高层语义到低层控制」的累计误差。

亮点与局限

亮点

  1. 问题重新定义:把类人导航从「2D 路径 + 低层控制」升级成「全身动作联合决策」,是问题视角的升维;
  2. 数据合成流水线四段式可复用:全局规划 → 运动生成 → 障碍感知编辑 → RL 跟踪,这一组合在其他形态(机械臂、双足机器人)同样适用;
  3. 仿真到零样本实机的稳健迁移:依赖 Unitree G1 的动力学随机化和大规模场景多样性,但完全不需要真实导航数据。

局限

  1. 数据合成依赖仿真器质量:杂乱场景的丰富度上限取决于仿真资产库的密度;
  2. 29-DoF 动作空间带来高维策略学习负担:需要更大的网络容量和训练数据规模,原文未明确模型参数量和训练 GPU 小时数;
  3. 语言指令粒度未严格分层:是粗粒度(「去厨房」)还是细粒度(「绕过这把椅子」)未在 abstract 区分;
  4. 实机实验规模有限:abstract 只说「robust language-guided traversal」,具体跨多少场景、多少指令类型、失败率等数字未披露,原文未明确;
  5. 依赖下游全身控制器:策略输出是关节目标,必须配合训练良好的跟踪器才能工作,部署门槛较高。

对工程落地的启发

  • 轮式底盘 + 简单导航 的场景不必上 TANGO:传统 2D 路径规划已足够;
  • 类人 + 杂乱 + 自然语言指令 的真实家庭服务、仓储巡检、救援等场景,TANGO 的「数据合成四段式」可以作为参考模板;
  • 工程落地优先验证三件事:仿真器资产密度、跟踪器稳定性、sim2real 漂移程度——三者有一项不达标,整个策略就需要重训或重新设计;
  • 开源状态:原文 abstract 未明确 GitHub URL(仅 abstract 给出的链接是 arxiv HTML),实际部署前需查 PDF 与项目主页确认代码是否公开。

与同方向工作的关系

TANGO 的工作位于「VLA + 类人全身控制」的交叉点。同方向相关工作包括:

  • 类人全身控制:如 Unitree 自家控制栈、H1/G1 上的 MPC+WBIC 方案——这些是 TANGO 的下游执行器;
  • VLA 模型:PaLM-E、RT-2、OpenVLA 等通用 VLA 把语言指令映射到机械臂末端动作,但几乎不涉及类人全身自由度
  • VLN 经典工作(Matterport3D、R2R、REVERIE 等):基于轮式/离散节点的导航评测,与 TANGO 的「类人连续动作空间」设定正交。

TANGO 的独特定位是「把 VLA 的输出维度从末端 6-DoF 推到全身 29-DoF,并用仿真合成流水线解决训练数据稀缺」。

适合谁读

  • 类人机器人整机系统的工程师:关心仿真数据合成、sim2real、低层跟踪器集成;
  • VLA 模型的研究者:关心连续高维动作空间下的策略学习、关节级监督信号;
  • 家庭服务 / 杂乱环境导航的产品负责人:评估「语言指令 + 类人形态」组合的成熟度与落地节奏;
  • 不适合只关心 2D 路径规划或纯底盘导航的读者——TANGO 的复杂度对他们是 over-spec。

工程落地与核查(Jay)

存疑待核实项(⚠️)

  1. GitHub 代码仓库:原解读注「原文 abstract 未明确 GitHub URL」,在 arxiv HTML 页搜索未见明确 GitHub 链接;网站 tango-vla.github.io 存在,但未在首屏显式提供代码仓库地址;需查原文 PDF 或联系作者确认代码是否已公开。
  2. SOTA 基准名称:原解读注「abstract 未列」,全文具体基准名(HB-PNL、IGB-VLN 等)未 fetch 核实,属存疑。
  3. 实机实验规模:abstract 称「零样本实机穿越」,但未披露具体场景数、指令条数、成功率;⚠️ 数字未披露,无法评估泛化边界。
  4. 模型参数量与训练算力:原解读已注,补充:全文未披露 GPU 小时数,对工程预算评估是盲区。
  5. 语言指令粒度:原解读已注,abstract 无区分,粗/细粒度混用情况未知。

实际系统怎么部署

根据 arxiv HTML(Section Deployment)披露的架构信息:

  • VLA 模块(System-2 / System-1):部署在配备 RTX PRO 6000 的集群服务器上,承担「慢思考」语义决策;
  • SONIC 跟踪器(System-0):部署在 Jetson Orin NX 板载端,负责高频全身控制(≥100Hz);
  • 通信方式:标准 IP 网络连接服务器与机器人,控制回路延迟对网络带宽/抖动有要求。

⚠️ 注意:原解读未提及这一云边分离架构;实机部署时需要同时维护服务器端推理和边缘端跟踪两套系统。

工程落地三步核查清单

检查项 操作 通过标准
代码可获取性 tango-vla.github.io 或联系作者 GitHub / 项目页明确提供可运行代码
仿真器资产密度 检查训练用仿真场景数量与障碍物多样性 杂乱场景 ≥ 50 种障碍类型,覆盖家庭/仓储/办公
跟踪器稳定性 在 Unitree G1 上单独验证 SONIC 跟踪器的稳态误差 关节跟踪 RMSE < 5°,高频响应 ≥ 100Hz
sim2real 漂移评估 在 3 种以上真实场景测 29-DoF 动作执行成功率 零样本场景 ≥ 70% 穿越成功率
云边通信延迟 测 VLA 推理延迟 + 网络 RTT + 跟踪器同步抖动 端到端反应时间 < 500ms(实时导航可用)

主要工程坑点

  1. 仿真器资产是瓶颈:若仿真场景多样性不足,29-DoF 全身动作在真实环境的避障表现会显著低于仿真;需要大量人工或程序化场景资产投入。
  2. 跟踪器与 VLA 耦合调试复杂:VLA 输出的关节目标是「理想值」,跟踪器跟踪误差会累积到导航成功率里;两者需要联合调试,单测一方不够。
  3. 云边架构的实时性约束:VLA 在服务器端推理(可能 > 200ms),再通过网络下发到 Jetson;机器人响应速度受网络抖动影响,在真实室内环境可能不够实时。
  4. Unitree G1 硬件差异:同型号机器人个体间关节限位、电机特性存在差异;仿真训练的策略直接零样本迁移时需要额外在线适配步骤。
  5. 部署门槛高:需要同时具备:①类人机器人硬件 + ②全身控制器固件 + ③服务器端 VLA 推理能力 + ④稳定的 WiFi/有线通信——目前任何单一团队都难以全套自研,建议以集成方案为主。

实用建议

  • 先用开源 VLA 底座:若 TANGO 未开源,可尝试用 OpenVLA 或 RT-2 的开源权重替换 VLA 主干,复用其仿真合成流水线,先跑通端到端;
  • 分阶段验证:先在纯仿真验证四段式流水线 → 再在单臂/单腿降级场景验证跟踪器 → 最后上整机零样本;
  • 关注 SIGGRAPH / RSS 2026 相关工作:TANGO 同期可能有配套的仿真资产库和跟踪器开源,可做横向对比。