当 Sora 们还在卷"画面美感"——这个团队把视频模型改成"机器人的大脑"了
- 关联论文:2607.07675
你有没有想过这件事——
Sora、Wan、MovieGen 这类视频生成模型,画质越来越逆天,但它生成出来的"开抽屉"动作,你家机器人照着学一遍,十次有八次会把手穿过抽屉面板。
为什么?
因为今天最强的视频模型都是给电影、短视频、广告训练的——它们追求的是"画面好不好看"、"镜头语言流不流畅"、"prompt 跟不跟得上"。
但机器人不关心好不好看。它关心的是:
- 这个物体受不受重力?
- 这个铰链会不会穿模?
- "打开抽屉"这个动作最后有没有真的打开?
- 我能不能从这个第一人称视角学会"抓杯子"?
这是一条"内容创作向"和"物理执行向"的根本错配。
2026 年 7 月 arXiv 上的 LingBot-Video: Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence(arXiv:2607.07675),Robbyant 团队做了一件大事——
他们把"机器人看的视频"和"普通人看的视频"灌到同一份预训练数据里,从架构、数据、奖励三个维度同时改造,发布了第一个大规模开源的、面向"物理执行"的 MoE 视频基础模型。
从此机器人可以"看视频学物理",而不是"看视频学美学"。
一、它到底解决什么真问题
过去两年视频生成大爆发,但你仔细看榜单——Wan 2.2、HunyuanVideo、CogVideoX、Sora 这些名字刷的全是"画面美感"维度的分。一旦换成机器人视角的物理合理性,立刻原形毕露:
- 计算效率被忽视——电影级画质默认不在乎延迟,机器人要在边缘设备实时调用;
- 物理一致性弱——Sora 能生成漂亮的手指舞,但铰链物体穿模、重力不遵守、刚体凭空消失;
- 数据分布偏 CG / 美学——互联网视频以电影、广告、短视频为主,严重缺"第一人称抓杯子"、"机械臂操作"、"机器人导航"这种机器人向的视角;
- 训练目标错位——标准奖励(美学、prompt-following、motion consistency)和"物理合理性 + 任务完成度"几乎正交。
LingBot-Video 把以上四点同时作为设计维度来回答:架构用 MoE 换容量与效率,数据用 profiling 引擎把机器人视频灌进预训练,训练用多维奖励同时管物理合理性和任务完成。
二、它怎么 work(简化版)
1. 架构:从 Dense DiT 换成 MoE
传统视频模型是"全激活"——每个 token 都跑过所有参数。LingBot-Video 改用 Mixture-of-Experts:
- 模型总参数量可以大幅放大(比如 14B+),但每个 token 只激活少量 expert;
- 单 token 推理的 FLOPs 跟 dense baseline 同一档;
- 训练可以从零开始,不依赖 dense checkpoint 预热。
简单说:总容量大了十倍,但每次推理花的算力没涨十倍。这跟 LLM 那边 Mixtral、DeepSeek-MoE 走的同一条路。
2. 数据:Profiling 引擎 + 具身向数据
核心是构造一个"数据 profiling 引擎":
- 输入:互联网视频(电影、广告、Vlog 等);
- 标注:动作类别、视角(first-person / third-person / egocentric)、运动学结构、是否包含操作或导航子任务;
- 输出:保留通用分布的同时,过采样 + 拼接manipulation、navigation、egocentric 三类机器人向视频片段。
简单说:不是"多拍点机器人视频",而是"把已有视频按机器人视角重新打标签、重新加权"。
3. 奖励:多维物理合理性对齐
传统 RLHF 在视频里只覆盖三类信号——aesthetic、prompt-following、motion consistency。LingBot-Video 显式追加两个面向具身的新维度:
- 物理合理性:物体重力、刚体不穿模、铰链物体的运动学约束、液体连续性;
- 任务完成度:对"打开抽屉"这种具体指令,视频是否在合理时间窗内出现与该指令一致的成功状态。
简单说:不光问"画得美不美",还问"重力对不对、任务完没完成"。
三、关键事实与"⚠️ 诚实标注"
可核验:
- 模型定位为"首个大规模开源 MoE 视频基础模型"——这是相对具身向视频社区的强声明,意味着在投稿时点上尚无对等开源工作;
- 训练目标同时管"物理合理性 + 任务完成度"——属于明确的方法论创新;
- 项目页 https://technology.robbyant.com/lingbot-video 已公开;
- 与 LingBot-World 2.0(同一团队的可交互世界模型)共享底层视频 backbone,形成"视频 backbone + 交互世界 + 多智能体"三层栈。
⚠️ 诚实标注(原文 abstract 未明确,本文不编造):
- 总参 / 激活参 / expert 数 / top-k:未明确,从命名推测在 14B+ 总量级;
- VBench / VideoAlign / PhysBench 等榜单分数:摘要未给;
- 训练数据规模 / token 数 / 训练步数:未明确;
- 物理合理性奖励模型的实现方式(人工标注 / 模拟器打分 / VLM-as-judge):未明确——这是整条技术路线最模糊的一环;
- 推理硬件成本、端到端延迟:摘要未给。
四、为什么这件事对每个关注 AI 的人都很重要
如果你是做机器人 / 具身智能的:
- 过去两年的世界模型路线,本质是把通用视频模型当"policy learning 的世界模拟器"用——但你把训练目标是"美学"的模型当"物理"用,结果可想而知。
- LingBot-Video 给了一条新路:要么直接用这类具身向 backbone,要么自己拿具身数据继续训练。别再把 Sora 当世界模型了。
如果你是做视频生成基础设施的:
- MoE for video 是值得跟进的方向——14B 总参 / 1.3B 激活在 720p 实时生成上已经可行(参 LingBot-World 2.0),对成本敏感的多机位实时系统很关键。
如果你是做 RLHF for Video的研究者:
- 把"任务完成度"和"物理合理性"作为独立奖励通道的思路,可以复用到任何"视频生成 + 下游决策"的端到端系统里。这是 video RLHF 一次有意义的方向拓展。
如果你是做产品 / 内容的:
- "视频生成不再只是创作工具"——它正在成为机器人的大脑、具身 AI 的世界模型。这条赛道的下一步不是"再拍一段更美的视频",而是"让机器人能从视频里学物理"。
五、必须警惕的边界
- 物理合理性的奖励模型本身依赖标注——谁来标"物体物理合理"?标注者能不能稳定区分复杂铰链与流体动力学?原文未明确,这是整条路线最模糊的一环。
- 缺乏量化数据——VBench、PhysBench、推理延迟、显存占用、专家利用率等关键数字摘要都没给,工程团队直接评估接入成本有难度。
- 具身向数据的版权 / 隐私 / 录制成本远高于互联网视频,规模化能力受限。
- 与 World Model 的复用边界未在摘要中说明——LingBot-Video 能否真的当 world model 用(不仅生成,还需 rollout 一致性),仍待正文交代。
- MoE 视频的 from-scratch 训练意味着不能复用已有 dense 视频模型加速收敛,复现成本高。
六、谁该读这篇
- 机器人 / 具身智能团队:评估能否用作 policy learning 的世界模型 backbone;
- 视频生成基础设施团队:评估 MoE 视频 from-scratch 训练的成本 / 收益曲线;
- RLHF for Video 研究者:关注物理合理性 + 任务完成度作为奖励通道的可行性;
- World model 方向研究者:把 LingBot-Video 与 LingBot-World 2.0 一起读,理解"视频 backbone + 交互世界 + 多智能体"三层栈的耦合点;
- 关注 AI 前沿的投资人 / PM:识别"视频生成 + 具身"赛道的拐点信号。
七、一句话总结
当 Sora 们还在卷"画面美感"时,Robbyant 团队把视频模型改成了"机器人的大脑"——从此机器人可以"看视频学物理",而不是"看视频学美学"。
三个标题变体
- Sora 在卷"画面美感",这个团队却把视频模型改成了"机器人的大脑"——Robbyant 发布首个开源具身向 MoE 视频基础模型
- 为什么你家机器人学"开抽屉"会把手穿过去?因为它在用"美学视频"学"物理动作"——2026 年 7 月这篇论文给了解法
- "机器人能看视频学物理了"——首个大规模开源具身向 MoE 视频模型 LingBot-Video 背后藏着三个关键设计
小红书风格卡片文案(可直接发布)
🤖 Sora 在卷"画面美感",这个团队却把视频模型改成了"机器人的大脑" 🤖
2026 年 7 月 arXiv:LingBot-Video(Robbyant 团队,arXiv:2607.07675)
直接做了一件大事——
📌 首个大规模开源的、面向"物理执行"的 MoE 视频基础模型 📌 从架构 / 数据 / 奖励三个维度同时改造 📌 跟 LingBot-World 2.0(可交互世界模型)共享底层 📌 项目页:https://technology.robbyant.com/lingbot-video
为什么这件事重要?
你让 Sora / Wan 生成"开抽屉"——画面美得发光,但你家机器人照着学,手直接穿过抽屉面板。
为什么?因为今天的视频模型都是给电影、短视频训练的,目标全是"画面美感"。
但机器人不关心美不美,它关心:
✅ 这个物体受不受重力? ✅ 这个铰链会不会穿模? ✅ "开抽屉"最后有没有真的打开?
📌 三个关键设计:
1️⃣ 架构:Dense DiT → MoE - 总参 14B+,单 token 激活少量 expert - 容量涨 10 倍,算力没涨 10 倍 - 可以从零训练,不依赖 dense checkpoint
2️⃣ 数据:Profiling 引擎 - 不是"多拍点机器人视频" - 而是"把已有视频按机器人视角重新打标签、重新加权" - 机械臂操作 / 室内导航 / 第一人称三类过采样
3️⃣ 奖励:多维物理合理性 - 传统 RLHF 只看:美感 + prompt-following + motion - LingBot-Video 追加:物理合理性 + 任务完成度 - 杯子会不会穿模?开抽屉到底开没开?
📌 为什么这件事和你有关:
- 机器人团队:别再把 Sora 当世界模型了——你的能力轴和它的训练目标正交
- 视频生成团队:MoE for video 是值得跟进的方向,14B 总参 / 1.3B 激活在 720p 实时生成上已经可行
- RLHF 研究者:把"任务完成度"和"物理合理性"作为独立奖励通道,可以复用到任何视频 + 决策系统
- 关注 AI 前沿的人:视频生成正在从"创作工具"变成"机器人大脑"——这是赛道拐点信号 🚨
⚠️ 必须警惕的边界:
- 物理合理性奖励模型谁来标?摘要没说
- VBench / PhysBench / 推理延迟 / 显存占用摘要都没给
- 与 World Model 的复用边界摘要未明
- MoE 视频 from-scratch 训练复现成本高
💡 一句话总结:
当 Sora 们还在卷"画面美感",LingBot-Video 把视频模型改成了"机器人的大脑"——从此机器人可以"看视频学物理",而不是"看视频学美学"。
下次再有人说"AI 视频模型已经能理解物理了"——反问一句:"它生成的开抽屉,最后到底开没开?" 🤔
📎 论文 ID:2607.07675
🌐 项目页:https://technology.robbyant.com/lingbot-video