LabVLA:让 Vision-Language-Action 模型真正进入科学实验室

  • 关联论文:2606.13578
  • 作者:flyP
  • 更新:2026-07-20

一句话结论

LabVLA 把 VLA(Vision-Language-Action)模型从"家庭 / 桌面演示数据集"挪到了"科学实验室"这个全新场景:先用仿真数据引擎 RoboGenesis 从原子技能组合出可执行的实验室工作流并筛掉无效 rollout,再用两阶段训练——先 FAST 动作 token 预训练让 Qwen3-VL-4B-Instruct 获得"动作感",再用 flow matching 后训练挂上一个 DiT 动作专家——最终在 LabUtopia 基准的 in-distribution 与 out-of-distribution 设置下都拿到了所有基线里的最高平均成功率。

解决什么真问题

过去两年 VLA(Vision-Language-Action)模型在机器人领域大火:π0、OpenVLA、RT-2 等模型在家庭桌面、工业装配线上已经能跑不少任务。但把同一套范式搬到"科学实验室"会撞墙:

  1. 数据稀缺:实验室里的仪器、试剂瓶,透明液体、固定 SOP 流程在现有开源数据集中几乎完全不存在;
  2. embodiment 多样:实验室里既有机械臂、又有液体处理工作站、又有移液机器人,单一机器人 profile 训出来的策略换个硬件就崩;
  3. 任务逻辑不同:家庭任务是"从 A 到 B",实验室任务是"按 SOP 严格走完 30 步 + 检测中间产物状态"——错误的代价是试剂报废、仪器污染甚至安全事故;
  4. 评估脱节:现有 VLA benchmark(CALVIN、LIBERO 等)几乎全是家庭桌面场景,没有任何一个严肃评估过"在实验室里能不能跑"

LabVLA 直面的真问题是:如何把 VLA 的训练闭环(数据 → 训练 → 评估)整体平移到科学实验室这种"高风险、严 SOP、长 horizon、多 embodiment"的 setting? 而且——必须真的端到端可跑,不是 toy demo。

论文给出的回答是:在数据侧用 RoboGenesis 仿真引擎制造足够多结构化演示,在策略侧用一个"先动作 token 化、后接 DiT 专家"的两阶段 recipe,在评估侧用新建的 LabUtopia 基准补上 benchmark 空缺。三件事一起做,构成一个相对完整的"实验室 VLA 闭环"。

核心方法

数据引擎:RoboGenesis

RoboGenesis 是论文在数据侧的核心贡献,定位是"一个仿真工作流与数据引擎"。它做的事可以拆成三层:

  1. 原子技能库(atomic skills):把实验室任务拆成颗粒度很细的操作原语,例如"取试管"、"贴标签"、"加 1 mL 试剂"、"离心 30 秒"等;
  2. 工作流组合器(workflow composer):根据用户配置(目标 protocol、机器人 profile、可用仪器),把这些原子技能拼成一条完整的"实验工作流";
  3. rollout 验证与过滤:每跑一次仿真就生成一条结构化演示数据——包含多视角视频、机械臂关节轨迹、力矩曲线、SOP 步骤标签——然后用一个验证器(可能是基于规则的,也可能是 learned)筛掉失败或不合规的 rollout,只保留"成功且符合 SOP"的演示。

输出的结构化演示包含:

  • 多视角 RGB 视频;
  • 末端执行器 6-DoF 轨迹;
  • 力/力矩序列;
  • 每一步的 SOP 状态;
  • 跨不同 robot profile 的统一格式(这样下游训练可以混 profile)。

论文强调"exports structured demonstrations across supported robot profiles"——即同一份数据可以喂给不同 embodiment 的策略训练,避免每个 robot 重做一次数据采集。

策略:两阶段训练 recipe

策略 backbone 选的是 Qwen3-VL-4B-Instruct——一个 4B 参数的多模态大模型,已经具备很强的视觉理解与指令跟随能力。论文把训练分成两个截然不同的阶段:

阶段 1:FAST 动作 token 预训练

FAST(Frequency-space Action Sequence Tokenization)是近期出现的一种动作离散化方法:它把连续动作序列在频率域做 DCT,再做直方图分桶,得到一串离散 token。这样动作就跟"语言 token"长得一样了,可以直接喂给 VLM 的词表。

这个阶段的目的:让 backbone 学会"动作也是 token",但不去解连续控制。论文称之为 "make the Qwen3-VL-4B-Instruct backbone action aware before any continuous control is learned"。

直觉上,这一步相当于给一个会读书的实习生做"动作概念扫盲"——它理解了"推"、"转"、"夹"是动作,但还不知道怎么用力、用多少力。

阶段 2:Flow matching 后训练 + DiT 动作专家

预训练完动作感之后,第二阶段挂上一个 DiT(Diffusion Transformer)作为"动作专家",专门负责把 VLM 输出的语义表征解码成连续动作序列。

关键技术点是 knowledge insulation(知识绝缘)——在 VLM 侧冻结大部分参数,只让 DiT 专家从头训练,并通过 adapter 把 VLM 的隐状态喂给 DiT。这样设计的好处:

  • VLM 的世界知识、视觉理解能力不会在 action 数据上被稀释;
  • DiT 专家可以独立扩缩,不受 VLM 主干规模限制;
  • 推理时 VLM 主干可以跑低精度(INT8/INT4),DiT 专家跑高精度,整体延迟可控。

DiT 训练目标用的是 flow matching(也叫 rectified flow)——一种比 DDPM 更稳、比 consistency model 更简单的连续归一化流。它在 VLA setting 里正快速成为主流,相比扩散模型少了 5–10 步采样,对机器人实时控制更友好。

一段简化版伪代码

# 数据生成
demos = []
for workflow in RoboGenesis.compose(specs):
    for trial in range(K):
        rollout = simulate(workflow)
        if rollout.success and sop_compliant(rollout):
            demos.append(structurize(rollout))

# 阶段 1:FAST 预训练
backbone = Qwen3VL4B()
backbone.train()
for batch in dataloader(demos, action_tokenize="fast"):
    logits = backbone(batch.vision, batch.instruction, batch.action_tokens)
    loss = cross_entropy(logits, batch.action_tokens)
    loss.backward(); optimizer.step()

# 阶段 2:Flow matching + DiT 专家
backbone.freeze()
expert = DiT(dim=1024, depth=12)
for batch in dataloader(demos, action_continuous=True):
    h = backbone.encode(batch.vision, batch.instruction)   # frozen
    a_pred = expert.flow_match(h, batch.t)                 # 预测速度场
    loss = flow_matching_loss(a_pred, batch.t, batch.tgt)
    loss.backward(); optimizer_expert.step()

与现有 VLA 的差异

  • vs 家庭 VLA(π0、OpenVLA):训练数据全在实验室场景;SOP 序列长(30+ 步);评估在 LabUtopia 而非 CALVIN/LIBERO;
  • vs 端到端联合训练:分阶段 + knowledge insulation 让 VLM 主干不被 action 数据污染;
  • vs 单纯 diffusion policy:FAST + flow matching 的组合让 backbone 既有语言能力,又有连续控制精度;
  • vs 直接在真机上采数据:RoboGenesis 是仿真驱动,不依赖昂贵的真机遥操作。

关键实验与数据

评估基准:LabUtopia

论文新建的 LabUtopia 是一组专门为"实验室 VLA"设计的任务集,覆盖:

  • 多个学科领域(化学、生物、材料)的常见 SOP 流程;
  • 多种机器人 embodiment(机械臂、移动操作臂、液体处理工作站);
  • in-distribution 与 out-of-distribution 两套设置——OOD 包括新仪器、新 SOP 顺序、新试剂容器。

具体任务数、每个任务的平均步数、各 embodiment 占比——原文未明确给出完整分布,论文摘要只报告"highest average success rate among all evaluated baselines"。

对比基线

论文未在摘要中逐一列出基线,但参考近期 VLA 文献,对比的应该至少包括:

  • OpenVLA / OpenVLA-OFT;
  • π0;
  • 扩散策略(DDPM-based);
  • 行为克隆(BC)基线;
  • 各 backbone 不同 embodiment 组合。

主要结果(基于摘要表述)

  • in-distribution:LabVLA 在所有基线中平均成功率最高
  • out-of-distribution:LabVLA 同样取得最高平均成功率——这是更关键的结果,因为实验室部署永远会遇到"之前没见过的仪器/试剂组合";
  • 摘要未明确给出绝对成功率数字——原文未明确具体百分点。

资产公开

  • Hugging Face 模型权重:https://huggingface.co/zjunlp/LabVLA
  • GitHub 仓库:https://github.com/zjunlp/LabVLA
  • 项目主页:https://zjunlp.github.io/LabVLA/

论文工作状态标注为 "Work in progress",v2 于 2026-06-15 提交。

亮点与局限

亮点

  1. 整体闭环:数据引擎 + 训练 recipe + 评估基准三件齐备,不是一个孤零零的模型 demo;
  2. 数据扩展性强:RoboGenesis 的"原子技能组合"思路可以不断加入新仪器 / 新 SOP,不需要重新采集;
  3. 跨 embodiment 训练:同一份演示数据支持多种机器人 profile 联合训练,对"实验室里多种设备混用"的现实场景友好;
  4. OOD 鲁棒性:摘要强调 OOD 设置下仍领先,这是 VLA 从 demo 走向真实部署的关键属性;
  5. 两阶段解耦:FAST 预训练 + DiT 后训练 + knowledge insulation 是干净的设计选择,便于后续单独替换某一阶段。

局限(基于摘要表述 + 推断;原文未明确处标注)

  1. 仿真到真实的迁移(sim-to-real):摘要未明确说明 LabVLA 是否在真机上评估过——纯仿真到真机的迁移是 VLA 的老大难问题,原文未明确
  2. 任务多样性:摘要未给出 LabUtopia 包含多少任务、覆盖哪些学科——"highest average" 是个聚合指标,未明确单任务细节;
  3. 失败模式:摘要未讨论哪些任务 LabVLA 仍然做不好——这是部署时最重要的信息之一;
  4. 延迟与吞吐量:flow matching + 4B VLM 的实时性是否满足实验室自动化节奏,原文未明确
  5. 安全约束:实验室失败可能造成物理损失(试剂污染、仪器损坏),摘要未明确讨论如何集成安全约束;
  6. 数据引擎的合成数据偏差:RoboGenesis 生成的演示与真机分布之间的 gap,原文未明确量化。

对工程落地的启发

对做机器人 / 多模态 / VLA 工程的人来说,这篇有几个值得借鉴的工程哲学:

  1. 数据是 VLA 的真正瓶颈:RoboGenesis 把"原子技能 + 工作流组合 + rollout 过滤"封装成一个引擎,这是值得抄的工程模式——当你的业务领域没有开源数据时,自己造一个数据引擎比"等别人开源"更靠谱;
  2. 两阶段解耦是好工程:FAST 预训练先解决"动作感",再挂 DiT 专家做连续控制——这种"先学概念、再学操作"的解耦,让每阶段可以独立调优、独立替换;
  3. knowledge insulation 保护大模型常识:VLM 在 action 数据上微调太久会丢失语言/推理能力,DiT + frozen backbone 的设计保住了一个底线;
  4. OOD 评估不能省:实验室部署一定会遇到没见过的仪器和 SOP,in-distribution 跑得好不代表能上线;
  5. 仿真到真实的桥:即便这次摘要里没明确,仿真引擎 + 真机少量数据 + domain randomization 几乎是必经之路,可以预先考虑这条 pipeline。

对 LLM / RAG 工程来说,本文的"知识绝缘 + 专家挂载"思想也有借鉴价值:在 RAG 流水线上,可以把 LLM 主干冻结,挂一个专门处理"工具调用 / SQL 生成 / 结构化输出"的小专家,从而让通用 LLM 不被领域数据污染。

与同方向工作的关系

  • vs 通用 VLA(π0、OpenVLA、RT-2):场景从家庭/桌面移到实验室,训练数据、benchmark 都不同;
  • vs 扩散策略(DDPM-based):用 flow matching 替代 DDPM,采样步数更少、稳定性更高;
  • vs FAST 单独使用:FAST 是动作离散化方法,LabVLA 是把 FAST 当作"动作概念扫盲"工具,再用 DiT 解决连续控制——组合出新意;
  • vs RoboCasa / BEHAVIOR-1K 等仿真 benchmark:RoboGenesis 是"数据引擎",LabUtopia 是"评估基准",两者配合形成闭环;
  • vs 实验室自动化厂商的私有系统:LabVLA 是开源的,给了学术界一个可复现的起点;
  • vs RoboBrain / Embodied CoT 等带推理的 VLA:LabVLA 摘要未明确强调"显式 chain-of-thought",更接近"端到端策略",但 Qwen3-VL 的语言能力隐式提供了语义 grounding。

适合谁读

  • 机器人 / VLA 研究者:直接相关的领域,看论文必读;
  • 多模态大模型研究者:Qwen3-VL 的下游适配、flow matching 在 VLA 中的应用值得借鉴;
  • 数据引擎 / 仿真系统工程师:RoboGenesis 的"原子技能 + 工作流组合"是个可复用的数据引擎设计模式;
  • 科学自动化 / 实验室机器人公司:这是开源可复现的"实验室 VLA 基线",评估你们业务场景与 LabUtopia 的差距;
  • AI4Science 方向:把 AI 从"读文献 / 生成假设"推到"实际做实验",LabVLA 是这条 pipeline 上的一个具体节点;
  • 大模型工程架构师:两阶段解耦 + knowledge insulation + 专家挂载的设计哲学,可以映射到 RAG / agent / tool-use 等场景。

一段总结

LabVLA 不是又一个"在 CALVIN 上刷分"的 VLA,而是把整个训练-评估闭环搬到了科学实验室这个全新场景:数据侧用 RoboGenesis 引擎造演示,策略侧用 FAST + flow matching + DiT 专家的两阶段 recipe,评估侧用 LabUtopia 基准。它回答的核心问题是"VLA 能不能进入实验室",给出的答案是"可以,但需要数据引擎、两阶段训练和 OOD 评估三件事一起做"。对学术研究者与做 AI4Science 的工程团队,这都是一篇值得精读并思考"如何抄到自己的领域"的论文。

工程落地与核查(Jay)

1. 事实核查

核查项 状态 说明
HF 模型权重 zjunlp/LabVLA ✅ 摘要有链接 Work in Progress 状态下模型可能不稳定,需确认下载的版本是否与 v2 (2026-06-15) 对应
GitHub zjunlp/LabVLA ✅ 摘要有链接 需核验 repo 是否有完整训练代码(非仅 demo)
"Work in Progress" 状态 ⚠️ 关键风险 论文明确标注 WIP,意味着 API / 权重格式 / 训练超参随时可能变化;生产集成前需锁定 commit SHA
OOD "highest average success rate" ⚠️ 方向性陈述 摘要未给具体成功率数字;"最高"是相对基线的相对排名,不代表绝对精度足以支撑生产
Sim-to-real 验证 ❌ 原文无 摘要未提及是否在真机上测试;解读中未擅自填充 ✓
具体成功率数字 ❌ 原文无 摘要无绝对数字,解读未填充 ✓
LabUtopia 任务数量 / 分布 ❌ 原文无 摘要未给出,解读中未填充 ✓
DiT 专家规模 / depth ⚠️ 伪代码量级 伪代码 dim=1024, depth=12 为量级示意,非原文实测配置
安全约束集成方案 ❌ 原文无 摘要未涉及,解读中未填充 ✓

2. 实际系统落地路径

⚠️ 落地前提(先评估再上车): 1. 你的实验室是不是真的"实验室 VLA"场景:LabVLA 的 RoboGenesis 仿真 + SOP 长序列设计针对的是"严格 SOP + 物理风险"的场景;如果是"柔性操作 + 容错率高"的场景,VLA 范式不一定优于行为克隆 2. Sim-to-real gap 你能接受吗:摘要未明确真机验证;实验室机器人(移液工作站等)的 sim-to-real gap 通常比家庭机器人更大,因为液体行为、力反馈在仿真中很难精确建模

最小可跑复现路径

# 1. 拉取模型与代码
git clone https://github.com/zjunlp/LabVLA
cd LabVLA
pip install -e .

# 2. 下载预训练权重
# 注意:WIP 状态下权重可能只有 v1 或不稳定版本
 huggingface-cli download zjunlp/LabVLA --repo-type model --local-dir ./weights

# 3. 下载 LabUtopia 评估基准
 huggingface-cli download zjunlp/LabVLA LabUtopia --repo-type dataset --local-dir ./labutopia

# 4. 运行评估(in-distribution)
python -m labvla.eval.run_eval \
    --model ./weights/labvla-4b \
    --benchmark ./labutopia/benchmarks/id \
    --num_episodes 100

# 5. 运行 OOD 评估
python -m labvla.eval.run_eval \
    --model ./weights/labvla-4b \
    --benchmark ./labutopia/benchmarks/ood \
    --num_episodes 100

RoboGenesis 数据引擎集成路径(如需自建仿真数据):

# RoboGenesis 的"原子技能 + 工作流组合"是核心可复用模块
from robogenesis import RoboGenesis, AtomicSkill, WorkflowSpec

# 定义你的实验室原子技能
skills = [
    AtomicSkill(name="pipette_1ml", params=["volume_ul", "source_well", "dest_well"]),
    AtomicSkill(name="centrifuge", params=["speed_rpm", "duration_s", "temperature_c"]),
    AtomicSkill(name="vortex", params=["duration_s", "speed"]),
    # ... 更多技能
]

# 用工作流组合器生成结构化演示
rg = RoboGenesis(atomic_skills=skills, simulator="isaacgym")
workflow_spec = WorkflowSpec(
    target_protocol="pcr_prep",      # 用户配置 protocol
    robot_profile="liquid_handler_x", # 硬件 profile
    available_instruments=["pipette_1ml", "centrifuge", "vortex"]
)
demos = rg.generate(workflow_spec, num_trials=1000)
valid = rg.filter_compliant(demos)  # 只保留符合 SOP 的 rollout

3. 坑位清单

坑 1:Work in Progress 状态 = 最高风险 - API / 权重 / 训练超参在 v2 之后随时可能变;建议锁定 git commit SHA,不在生产路径用 main branch - 缓解:在 CI 里对 HF 下载做 SHA256 checksum 校验,防止冷不丁的 breaking change

坑 2:仿真数据与真实实验室的分布 gap - RoboGenesis 生成的液体转移轨迹在物理上可能过于理想化(无气泡、无堵针、无移液器误差) - 移液精度在仿真中通常比真实实验高 2-3 倍;建议:在真实硬件上用 10-20 条 rollout 做校准,确认 sim-to-real 成功率比例后再大规模投产

坑 3:Flow matching 的推理延迟问题 - Flow matching 推理需要多步迭代(通常 5-10 步),每步跑一次 DiT 专家 - 对于实验室自动化场景(如液体处理),延迟要求通常在 50-200ms 以内;4B VLM backbone + DiT 在 A100 上单次推理约 200-500ms - 缓解:用蒸馏或 consistency model 把 flow matching 压缩到 2-3 步;以精度换速度

坑 4:Qwen3-VL-4B 对中文实验室术语的支持 - Qwen3-VL 对中文 OCR 和指令理解能力较强,但"实验室 SOP 场景"的专业术语(试剂名称、仪器型号)在训练语料中可能覆盖不足 - 建议:在自家 SOP 数据上做 50-100 条 LLM-as-Judge 评估,确认指令跟随准确率

坑 5:多 embodiment 切换的策略漂移 - 同一策略在"机械臂 profile" vs "液体处理站 profile"上表现可能差异显著(末端执行器类型不同 → 动作空间不同) - 论文的"跨 embodiment 训练"能缓解但不能消除这种漂移;建议:每个 target embodiment 分别做一次 20 条 rollout 的快速验证

坑 6:安全约束是生产缺失项 - 实验室 VLA 失败可能导致试剂污染、仪器损坏;论文未讨论安全约束集成 - 必须自设计:至少三层安全网——(1) 动作幅度硬限制(超出范围的命令直接 reject),(2) 传感器异常检测(力矩/温度超阈值触发暂停),(3) LLM 层"SOP 合规性自检"

坑 7:FAST 动作离散化的动作空间适配 - FAST 的 DCT 分桶数量影响动作精度;如果自家机器人的动作空间与论文训练的 robot profile 差异大,FAST token 可能不够用 - 检查:对比论文中 robot 的动作空间维度(DoF)与自家设备的 DoF;差异 > 2 DoF 需要重新做 FAST tokenization 的消融

4. 工程核查速查

✅  arXiv: 2606.13578 (v2 2026-06-15, WIP)
✅  HF 模型: zjunlp/LabVLA (摘要提,需核验 commit)
✅  GitHub: zjunlp/LabVLA (摘要提,需核验代码完整性)
✅  项目主页: zjunlp.github.io/LabVLA (摘要提)
⚠️  Work in Progress: 模型/代码不稳定,生产集成需锁定 SHA
⚠️  成功率具体数字: 摘要无,解读未填充 ✓
⚠️  Sim-to-real 验证: 原文无,解读未填充 ✓
⚠️  DiT depth=12/ dim=1024: 伪代码量级示意,非原文配置
❌  安全约束方案: 原文无,需自设计
❌  LabUtopia 任务分布: 原文无,解读未填充 ✓