当 Sora 们还在卷"画面美感"——这个团队把视频模型改成"机器人的大脑"了

  • 关联论文:2607.07675

你有没有想过这件事——

Sora、Wan、MovieGen 这类视频生成模型,画质越来越逆天,但它生成出来的"开抽屉"动作,你家机器人照着学一遍,十次有八次会把手穿过抽屉面板

为什么?

因为今天最强的视频模型都是给电影、短视频、广告训练的——它们追求的是"画面好不好看"、"镜头语言流不流畅"、"prompt 跟不跟得上"。

机器人不关心好不好看。它关心的是:

  • 这个物体受不受重力?
  • 这个铰链会不会穿模?
  • "打开抽屉"这个动作最后有没有真的打开?
  • 我能不能从这个第一人称视角学会"抓杯子"?

这是一条"内容创作向"和"物理执行向"的根本错配

2026 年 7 月 arXiv 上的 LingBot-Video: Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence(arXiv:2607.07675),Robbyant 团队做了一件大事——

他们把"机器人看的视频"和"普通人看的视频"灌到同一份预训练数据里,从架构、数据、奖励三个维度同时改造,发布了第一个大规模开源的、面向"物理执行"的 MoE 视频基础模型。

从此机器人可以"看视频学物理",而不是"看视频学美学"。

一、它到底解决什么真问题

过去两年视频生成大爆发,但你仔细看榜单——Wan 2.2、HunyuanVideo、CogVideoX、Sora 这些名字刷的全是"画面美感"维度的分。一旦换成机器人视角的物理合理性,立刻原形毕露:

  1. 计算效率被忽视——电影级画质默认不在乎延迟,机器人要在边缘设备实时调用;
  2. 物理一致性弱——Sora 能生成漂亮的手指舞,但铰链物体穿模、重力不遵守、刚体凭空消失;
  3. 数据分布偏 CG / 美学——互联网视频以电影、广告、短视频为主,严重缺"第一人称抓杯子"、"机械臂操作"、"机器人导航"这种机器人向的视角
  4. 训练目标错位——标准奖励(美学、prompt-following、motion consistency)和"物理合理性 + 任务完成度"几乎正交。

LingBot-Video 把以上四点同时作为设计维度来回答:架构用 MoE 换容量与效率,数据用 profiling 引擎把机器人视频灌进预训练,训练用多维奖励同时管物理合理性和任务完成。

二、它怎么 work(简化版)

1. 架构:从 Dense DiT 换成 MoE

传统视频模型是"全激活"——每个 token 都跑过所有参数。LingBot-Video 改用 Mixture-of-Experts

  • 模型总参数量可以大幅放大(比如 14B+),但每个 token 只激活少量 expert;
  • 单 token 推理的 FLOPs 跟 dense baseline 同一档;
  • 训练可以从零开始,不依赖 dense checkpoint 预热

简单说:总容量大了十倍,但每次推理花的算力没涨十倍。这跟 LLM 那边 Mixtral、DeepSeek-MoE 走的同一条路。

2. 数据:Profiling 引擎 + 具身向数据

核心是构造一个"数据 profiling 引擎":

  • 输入:互联网视频(电影、广告、Vlog 等);
  • 标注:动作类别、视角(first-person / third-person / egocentric)、运动学结构、是否包含操作或导航子任务;
  • 输出:保留通用分布的同时,过采样 + 拼接manipulation、navigation、egocentric 三类机器人向视频片段。

简单说:不是"多拍点机器人视频",而是"把已有视频按机器人视角重新打标签、重新加权"

3. 奖励:多维物理合理性对齐

传统 RLHF 在视频里只覆盖三类信号——aesthetic、prompt-following、motion consistency。LingBot-Video 显式追加两个面向具身的新维度

  • 物理合理性:物体重力、刚体不穿模、铰链物体的运动学约束、液体连续性;
  • 任务完成度:对"打开抽屉"这种具体指令,视频是否在合理时间窗内出现与该指令一致的成功状态。

简单说:不光问"画得美不美",还问"重力对不对、任务完没完成"

三、关键事实与"⚠️ 诚实标注"

可核验

  • 模型定位为"首个大规模开源 MoE 视频基础模型"——这是相对具身向视频社区的强声明,意味着在投稿时点上尚无对等开源工作;
  • 训练目标同时管"物理合理性 + 任务完成度"——属于明确的方法论创新;
  • 项目页 https://technology.robbyant.com/lingbot-video 已公开;
  • 与 LingBot-World 2.0(同一团队的可交互世界模型)共享底层视频 backbone,形成"视频 backbone + 交互世界 + 多智能体"三层栈。

⚠️ 诚实标注(原文 abstract 未明确,本文不编造)

  • 总参 / 激活参 / expert 数 / top-k:未明确,从命名推测在 14B+ 总量级;
  • VBench / VideoAlign / PhysBench 等榜单分数:摘要未给;
  • 训练数据规模 / token 数 / 训练步数:未明确;
  • 物理合理性奖励模型的实现方式(人工标注 / 模拟器打分 / VLM-as-judge):未明确——这是整条技术路线最模糊的一环;
  • 推理硬件成本、端到端延迟:摘要未给。

四、为什么这件事对每个关注 AI 的人都很重要

如果你是做机器人 / 具身智能的:

  • 过去两年的世界模型路线,本质是把通用视频模型当"policy learning 的世界模拟器"用——但你把训练目标是"美学"的模型当"物理"用,结果可想而知。
  • LingBot-Video 给了一条新路:要么直接用这类具身向 backbone,要么自己拿具身数据继续训练别再把 Sora 当世界模型了

如果你是做视频生成基础设施的:

  • MoE for video 是值得跟进的方向——14B 总参 / 1.3B 激活在 720p 实时生成上已经可行(参 LingBot-World 2.0),对成本敏感的多机位实时系统很关键。

如果你是做 RLHF for Video的研究者:

  • 把"任务完成度"和"物理合理性"作为独立奖励通道的思路,可以复用到任何"视频生成 + 下游决策"的端到端系统里。这是 video RLHF 一次有意义的方向拓展。

如果你是做产品 / 内容的:

  • "视频生成不再只是创作工具"——它正在成为机器人的大脑、具身 AI 的世界模型。这条赛道的下一步不是"再拍一段更美的视频",而是"让机器人能从视频里学物理"。

五、必须警惕的边界

  1. 物理合理性的奖励模型本身依赖标注——谁来标"物体物理合理"?标注者能不能稳定区分复杂铰链与流体动力学?原文未明确,这是整条路线最模糊的一环。
  2. 缺乏量化数据——VBench、PhysBench、推理延迟、显存占用、专家利用率等关键数字摘要都没给,工程团队直接评估接入成本有难度。
  3. 具身向数据的版权 / 隐私 / 录制成本远高于互联网视频,规模化能力受限。
  4. 与 World Model 的复用边界未在摘要中说明——LingBot-Video 能否真的当 world model 用(不仅生成,还需 rollout 一致性),仍待正文交代。
  5. MoE 视频的 from-scratch 训练意味着不能复用已有 dense 视频模型加速收敛,复现成本高。

六、谁该读这篇

  • 机器人 / 具身智能团队:评估能否用作 policy learning 的世界模型 backbone;
  • 视频生成基础设施团队:评估 MoE 视频 from-scratch 训练的成本 / 收益曲线;
  • RLHF for Video 研究者:关注物理合理性 + 任务完成度作为奖励通道的可行性;
  • World model 方向研究者:把 LingBot-Video 与 LingBot-World 2.0 一起读,理解"视频 backbone + 交互世界 + 多智能体"三层栈的耦合点;
  • 关注 AI 前沿的投资人 / PM:识别"视频生成 + 具身"赛道的拐点信号。

七、一句话总结

当 Sora 们还在卷"画面美感"时,Robbyant 团队把视频模型改成了"机器人的大脑"——从此机器人可以"看视频学物理",而不是"看视频学美学"。


三个标题变体

  1. Sora 在卷"画面美感",这个团队却把视频模型改成了"机器人的大脑"——Robbyant 发布首个开源具身向 MoE 视频基础模型
  2. 为什么你家机器人学"开抽屉"会把手穿过去?因为它在用"美学视频"学"物理动作"——2026 年 7 月这篇论文给了解法
  3. "机器人能看视频学物理了"——首个大规模开源具身向 MoE 视频模型 LingBot-Video 背后藏着三个关键设计

小红书风格卡片文案(可直接发布)

🤖 Sora 在卷"画面美感",这个团队却把视频模型改成了"机器人的大脑" 🤖

2026 年 7 月 arXiv:LingBot-Video(Robbyant 团队,arXiv:2607.07675)

直接做了一件大事——

📌 首个大规模开源的、面向"物理执行"的 MoE 视频基础模型 📌 从架构 / 数据 / 奖励三个维度同时改造 📌 跟 LingBot-World 2.0(可交互世界模型)共享底层 📌 项目页:https://technology.robbyant.com/lingbot-video

为什么这件事重要?

你让 Sora / Wan 生成"开抽屉"——画面美得发光,但你家机器人照着学,手直接穿过抽屉面板

为什么?因为今天的视频模型都是给电影、短视频训练的,目标全是"画面美感"。

但机器人不关心美不美,它关心:

✅ 这个物体受不受重力? ✅ 这个铰链会不会穿模? ✅ "开抽屉"最后有没有真的打开?

📌 三个关键设计

1️⃣ 架构:Dense DiT → MoE - 总参 14B+,单 token 激活少量 expert - 容量涨 10 倍,算力没涨 10 倍 - 可以从零训练,不依赖 dense checkpoint

2️⃣ 数据:Profiling 引擎 - 不是"多拍点机器人视频" - 而是"把已有视频按机器人视角重新打标签、重新加权" - 机械臂操作 / 室内导航 / 第一人称三类过采样

3️⃣ 奖励:多维物理合理性 - 传统 RLHF 只看:美感 + prompt-following + motion - LingBot-Video 追加:物理合理性 + 任务完成度 - 杯子会不会穿模?开抽屉到底开没开?

📌 为什么这件事和你有关

  • 机器人团队:别再把 Sora 当世界模型了——你的能力轴和它的训练目标正交
  • 视频生成团队:MoE for video 是值得跟进的方向,14B 总参 / 1.3B 激活在 720p 实时生成上已经可行
  • RLHF 研究者:把"任务完成度"和"物理合理性"作为独立奖励通道,可以复用到任何视频 + 决策系统
  • 关注 AI 前沿的人:视频生成正在从"创作工具"变成"机器人大脑"——这是赛道拐点信号 🚨

⚠️ 必须警惕的边界

  • 物理合理性奖励模型谁来标?摘要没说
  • VBench / PhysBench / 推理延迟 / 显存占用摘要都没给
  • 与 World Model 的复用边界摘要未明
  • MoE 视频 from-scratch 训练复现成本高

💡 一句话总结

当 Sora 们还在卷"画面美感",LingBot-Video 把视频模型改成了"机器人的大脑"——从此机器人可以"看视频学物理",而不是"看视频学美学"

下次再有人说"AI 视频模型已经能理解物理了"——反问一句:"它生成的开抽屉,最后到底开没开?" 🤔

📎 论文 ID:2607.07675
🌐 项目页:https://technology.robbyant.com/lingbot-video

人工智能 #AI科普 #机器人 #具身智能 #视频生成 #MoE #Sora #论文分享 #技术分享 #AI前沿 #开发者 #研究者