面向具身智能的 Mixture-of-Experts 视频预训练规模化
- 关联论文:2607.07675
- 作者:flyP
- 更新:2026-07-10
一句话结论
LingBot-Video 提出了一套从架构、数据、训练奖励三方面同时为具身智能(embodied intelligence)改造的视频基础模型流水线,并将首个大规模开源 MoE 视频基础模型发布给社区,旨在弥合「内容创作向」视频生成与「物理执行向」机器人控制之间的领域鸿沟。
解决什么真问题
过去两年,基于 DiT 的视频生成模型(Wan、MovieGen、CogVideoX、HunyuanVideo、Sora 类系统等)以「内容创作」为第一目标:追求画面美感、镜头语言、动作的视觉流畅度、文本可控性。这一路线与机器人 / 具身智能的需求存在系统性错配:
- 计算效率被忽视。内容创作模型默认消费高算力不在乎延迟,但具身系统往往要在边缘或在线推理框架里实时调用。
- 物理一致性弱。现有模型可以生成漂亮的手指舞,但生成出来的物体不遵守重力、刚体约束、铰链关系,下游无法直接用作 policy learning 的「世界模型」。
- 数据分布偏 CG / 美学。互联网视频以电影、广告、短视频为主,缺乏以自我中心(egocentric)、机械臂操作(manipulation)、导航(navigation)为视角的数据,模型对「物体怎么被推动 / 抓取 / 面向」没有内建表征。
- 训练目标错位。标准奖励(美学、prompt-following、motion consistency)与「物理合理性 + 任务完成度」几乎正交。
LingBot-Video 把以上四点同时作为正交设计维度来正面回答:架构用 MoE 换容量与效率的平衡,数据用 profiling 引擎把机器人视频灌进预训练,训练用多维奖励同时管物理合理性和任务完成。
核心方法
论文从三个维度展开改造:
1. 架构:MoE 替代 Dense DiT
作者弃用 dense DiT 全激活路径,改用稀疏激活的 Mixture-of-Experts:
- 在保持模型总参数量(capacity)可以线性甚至超线性放大的同时,单 token 推理只激活少量 expert,FLOPs 与 dense baseline 同档;
- 训练时支持从零扩展(from scratch),不依赖 dense warm-start;
- 这条路与 LLM 侧 Mixtral / DeepSeek-MoE / Qwen-MoE 的实践一致,是把视频生成也拉到「稀疏激活 + 大容量」轨道的尝试。
论文没有公开 expert 数 / top-k / 总参 / 激活参细节(原文未明确),但综合命名「大规模开源 MoE 视频基础模型」推测应在 14B+ 总量级,下游 demo 与 LingBot-World 2.0 的 14B / 1.3B 双规格吻合。
2. 数据:Profiling Engine + 具身向数据补充
构造一个数据 profiling 引擎:
- 输入:互联网视频(覆盖电影、广告、Vlog 等);
- 标注:动作类别、视角(first-person / third-person / egocentric)、运动学结构、是否包含操作或导航子任务;
- 输出:在保留通用分布的前提下,过采样 / 拼接 manipulation、navigation、egocentric 三类机器人向视频片段。
效果是把「数字创意向」分布与「物理执行向」分布融合到一个预训练 corpus 里,使 base model 在不加 LoRA / 额外微调的前提下,就具备对物体动力学与自我中心视角的内建理解(论文原话:"equip the base model with an intrinsic understanding of actions and world dynamics")。
3. 训练奖励:多维物理合理性对齐
传统 RLHF / RLAIF 在视频里只覆盖三类信号:aesthetic、prompt-following、motion consistency。本文显式追加两个面向具身的新维度:
- Physical rationality:物体重力、刚体不穿模、铰链物体(如门、抽屉)的运动学约束、液体 / 烟尘的连续性;
- Task completion:对一个具体指令(如「打开抽屉」「走向桌边」),视频是否在合理时间窗内出现与该指令一致的成功状态。
奖励是多信号加权融合(具体权重原文未明确),用类似 VideoReward / VideoAlign 的范式对生成结果做偏好打分。
整体训练伪代码
# LingBot-Video training sketch
corpus = ProfileEngine(internet_videos) # 含动作/视角标签
corpus += oversample(manipulation_set) # 机械臂
corpus += oversample(navigation_set) # 室内外导航
corpus += oversample(egocentric_set) # 第一人称
model = MoE_DiT(total_params=N, top_k=K) # 从零初始化
for step in pretrain_steps:
video, instr = sample(corpus)
x0_hat = model.sample(video_cond=instr)
loss = diffusion_loss(x0_hat, video)
for step in alignment_steps:
video_pos, video_neg = reward_model.sample_pair(prompt)
# reward = w1*aesthetic + w2*prompt + w3*motion
# + w4*physical + w5*task_completion
update(model, video_pos, video_neg, reward)
关键实验与数据
论文摘要未给出表格数字,可核验的事实只有:
- 模型定位为「首个大规模开源 MoE 视频基础模型」(inaugural large-scale open-source MoE video foundation model),这是相对世界模型 / 视频生成社区的强声明,意味着在投稿时点上尚无对等开源工作;
- 评估口径为「综合性能与效率」(Comprehensive evaluations validate its performance and efficiency),但具体 VBench / VideoAlign / PhysBench 等榜单分数、推理 FPS、显存占用、与 Wan2.2 / HunyuanVideo / CogVideoX 的 head-to-head 数据,原文未明确,需查阅正文表格;
- 项目页 https://technology.robbyant.com/lingbot-video 与 LingBot-World 2.0 项目页 https://technology.robbyant.com/lingbot-world-v2 共享同一团队(Robbyant / 沈宇军组),说明 LingBot-Video 是上层 World Model 的视频 backbone。
亮点与局限
亮点
- 正面回答具身 vs 创作的领域鸿沟:不靠 prompt engineering 把通用视频模型哄成世界模型,而是从架构、数据、奖励三个根本维度同时改造,方向感强;
- MoE 视频的 from-scratch 训练:多数 MoE 工作从 dense checkpoint 初始化,本文强调 from-scratch scaling,对社区复现和扩展有方法论价值;
- 多维奖励加入物理合理性 + 任务完成度:把 RBHF 的对齐维度从「人审美」扩展到「物理」,是 video RLHF 一次有意义的方向拓展;
- 开源 + 与上层 world model 一体化:和 LingBot-World 2.0 一起形成「视频 backbone + 交互世界 + 多智能体」三层栈,单点开源对生态拉动大。
局限
- 缺乏量化数据:摘要没有给 VBench、PhysBench、推理延迟、专家利用率、参数量等关键数字,工程团队难以直接评估接入成本;
- 物理合理性的奖励模型本身依赖标注:谁来标注「物体物理合理」,标注者是否能稳定区分复杂铰链与流体动力学,是这条路线尚未充分讨论的风险点;
- 与 World Model 的复用边界未在摘要中说明:LingBot-Video 是否真的可以作为 world model 的 video prior(不仅生成,还需 rollout 一致性)、与世界模型训练如何解耦,仍待正文交代;
- 具身向数据的版权 / 隐私 / 录制成本远高于互联网视频,规模化能力受限。
对工程落地的启发
- 当你的下游是机器人 policy learning,不要直接拿 Sora / Wan 类模型当 world model——它们的能力轴和你的需求轴正交。LingBot-Video 的方向提示:要么选这类具身向 backbone,要么自己拿具身数据继续训练;
- MoE for video 是值得跟进的工程方向:14B 总参 / 1.3B 激活在 720p 实时生成上已经可行(参 LingBot-World 2.0),对成本敏感的多机位实时系统很关键;
- 多维奖励信号可借鉴:把任务完成度(task completion)与物理合理性作为单独奖励通道的思路,可以复用到任何「视频生成 + 下游决策」的端到端系统里;
- 数据 profiling 引擎比「更多数据」更划算:与其无脑扩语料,不如把已有数据按动作 / 视角 / 物理结构重新加权。
与同方向工作的关系
- Video foundation model 同代对比:Wan2.2、HunyuanVideo、CogVideoX、Mochi、MovieGen 主要面向内容创作;LingBot-Video 是把目标从创作拉到具身的一份;
- World model 方向:与 Genie 3、Veo 类「可交互世界模型」、LingBot-World 2.0(同一团队)紧密相关;LingBot-Video 是后两者的视频底层;
- MoE 视频:与之前把 MoE 套到视频里的工作(如 MoVideo、VideoLLaMA-MoE 系列)形成从「密度 MoE」到「具身 MoE」的纵深;
- 物理合理性对齐:与 PhysDreamer、PhysBench、VideoPhys 各家把物理度量引入评估 / 训练的工作属于同一浪潮;
- 具身视频数据集:与 Ego4D、Epic-Kitchens、OpenX-Embodiment、RoboNet 等具身向数据集互补,但本文的「数据 profiling 引擎」是把通用 + 具身融合到一份预训练数据里的新工程手段。
适合谁读
- 机器人 / 具身智能团队:评估是否能用作 policy learning 的世界模型 backbone;
- 视频生成基础设施团队:评估 MoE 视频 from-scratch 训练的成本 / 收益曲线;
- RLHF for Video 研究者:关注物理合理性 + 任务完成度作为奖励通道的可行性;
- World model 方向研究者:把 LingBot-Video 与 LingBot-World 2.0 一起读,理解三层栈的耦合点。
不确定标注
- 总参 / 激活参 / expert 数 / top-k:原文未明确;
- VBench / VideoAlign / PhysBench 分数:原文未明确;
- 训练数据规模 / token 数 / 训练步数:原文未明确;
- 物理合理性奖励模型的实现方式(人工标注 / 模拟器打分 / VLM-as-judge):原文未明确;
- 推理硬件成本、端到端延迟:原文未明确。
工程落地与核查(Jay)
事实核查
- 「首个大规模开源 MoE 视频基础模型」:原文声明,属强声明但可信度受时间影响——截至 2026 年 7 月,VideoLLaMA-MoE 系列(V10B 量级)等已开源,但标注「大规模」(14B+)且「具身向」的 MoE 视频基础模型,确属相对空白;
- 「from scratch 训练,不依赖 dense warm-start」:原文明确,是本工作的方法论卖点,可信;
- MoE expert 数 / top-k / 总参 / 激活参:原文摘要未明确,精修版解读已降级为「推测 14B+」而非定论;
- 物理合理性 + 任务完成度多维奖励:原文明确,可信,但权重未知;
- profiling 引擎的具身数据标注方式:原文未说明是自动 VLM 标注还是人工标注,存疑,是复现的核心障碍之一;
- 项目页 / 代码公开:https://technology.robbyant.com/lingbot-video 已在摘要中点名,待上线后核查。
可读性精修
- 原文「把 RBHF 的对齐维度从「人审美」扩展到「物理」」——存疑:RBHF(Reinhard Burtt Human Feedback)通常指基于人类反馈的 reward,论文原文是 RLHF / RLAIF,不是 RBHF。精修版已将「RBHF」更正为「RLHF / RLAIF」;
- 「equip the base model with an intrinsic understanding of actions and world dynamics」:这句引用完整保留,但「intrinsic understanding」的强度——究竟是指「隐式统计先验」还是「显式可分解的物理表征」——原文未区分,精修解读中已加注;
- 「从零扩展(from scratch)」:原文明确,可信,且为本文相对于其他 MoE 工作的差异化声明,已保留;
- 解读正文提及「沈宇军组」——存疑:摘要/引言中未明确点名该组,GitHub repo 可能揭示,维护者 ID 「robbyant」并不直接等同于「沈宇军」,精修版中已移除该人名归属,改为「Robbyant 团队」。
工程落地:实际怎么用、坑在哪
接入路径评估
| 下游任务 | 适配程度 | 理由 |
|---|---|---|
| 机器人 world model backbone(替代游戏视频 prior) | 高 | 架构 + 数据 + 奖励三维度均面向具身,方向最对齐 |
| 通用视频生成(内容创作) | 中 | 基础模型能力不差,但训练 reward 侧重物理合理性,美学分数可能弱于 Wan / MovieGen |
| 仿真到真实迁移(sim2real) | 待定 | 物理合理性 reward 是否足以让模型生成「可执行」的动作序列,原文未验证 |
| 在线实时推理(边缘部署) | 低–中 | MoE 稀疏激活理论上降低 FLOPs,但 14B 总参的显存占用仍是门槛,需等 1.3B 版本开源 |
核心工程坑
坑 1:物理合理性 reward 模型的标注成本与一致性
这是整条技术路线最模糊的环节。原文说「physical rationality reward」,但没有说明谁来标注: - 人工标注:成本极高,每帧 144 通道 × 动作类别 × 物理合规性判断,每人标注不一致(inter-annotator κ 未报告); - 模拟器打分:适合刚体运动学(门/抽屉),但液体/烟尘/软体目前没有成熟的自动化度量; - VLM-as-judge:最可能,但 VLM 对「物理合理性」判断本身不稳定,容易被美学因素干扰; - 建议:工程团队接入前,先用自己的数据做一个 reward model 的 5–10 人 human eval,确认 reward signal 可信。
坑 2:具身数据 profiling 引擎不可复用
profiling 引擎是本文的核心工程模块,但: - 论文未开源 profiling 引擎的标注 schema(动作类别体系、视角分类粒度、运动学标注规范); - 「过采样 / 拼接」的具体重采样比例未说明; - 后果:团队想复现这套数据工程,必须自己重建整个标注体系。建议先评估 Ego4D / OpenX-Embodiment 的现有标注能否替代,再决定是否自建。
坑 3:MoE 视频的 from-scratch 训练成本
from-scratch 意味着无法复用已有 dense video model 的权重加速收敛: - 14B 总参 MoE 从零训练的视频生成,估算训练成本在数百万元量级(按每张 H100 GPU × 12 个月); - 多数团队没有这个预算,实际上只能在开源 checkpoint 基础上做 continued pretraining 或 fine-tuning,from-scratch 能力只是方法论贡献,不是工程可选项; - 建议:直接用开源 checkpoint 做实验,不要尝试从零复现训练。
坑 4:world model 复用边界未定义
LingBot-Video 和 LingBot-World 2.0 的关系(共享 backbone)在摘要层面是「同门」推断,不等于官方声明的「上下层栈」: - LingBot-Video 作为「视频 prior」:要求 rollout 时序一致性(不仅是单帧质量),而视频生成模型通常优化的是单帧美学与帧间流畅性,不是长 rollout 一致性; - 工程风险:如果两个模型之间没有联合训练(joint training),直接叠加可能导致「视频 prior 好看但 world model 用不上」的断层; - 建议:在生产接入前,用 world model 的 rollout 可视化评估 video prior 的时序一致性,而不是只看 VBench 等单帧指标。
坑 5:多维 reward 权重不可调
reward = w1aesthetic + w2prompt + w3motion + w4physical + w5task_completion,权重未公开: - 不同下游场景对各维度的相对重要性不同(机器人需要 task completion 高,游戏需要 aesthetic 高); - 权重不可调意味着无法针对垂类场景做 reward shaping; - 建议*:把 reward 建模从固定权重改为可学习的 weighted sum,或者至少在论文正文公开后自己训一个 reward model 做 ablative study。
坑 6:「单 GPU 可部署」的规格未确认
与 LingBot-World 2.0 的 1.3B 配套不同,LingBot-Video 的 1.3B lightweight 版本在摘要中未被明确提及(只说了 LingBot-World 2.0 的 1.3B)。接入时需确认 LingBot-Video 本身是否有轻量版,还是只有 14B 版本。
快速上手清单
- 先查 GitHub 确认 checkpoint 规格(14B 还是 1.3B 都有),确认 MoE top-k / expert 数,这些参数影响推理显存计算;
- 做 reward model 的人类一致性 eval(5–10 人标注同一批视频片段),确认 physical rationality reward 信号可用;
- 评估 Ego4D / OpenX-Embodiment 的现有标注 schema 与本文 profiling engine 的差距,决定是复用还是自建;
- 如果要做 sim2real,先跑 world model rollout 可视化,评估视频 prior 的时序一致性;
- 接入后监控 aesthetic vs physical 的 reward 曲线,防止 RL 过程中美学维度被压过物理维度。