你看过的"会动的视频"全是假的——2026 这篇论文,把"做菜 demo"做成了"看到哪儿做到哪儿"的闭环世界模型
- 关联论文:2610.12459
一句话故事
你有没有这种感觉:刷到一段"AI 做菜"的视频,翻面时刀工利落、火候精准,但你心里清楚——这不是 AI 真"看到"自己在做什么,而是按预设脚本拍好的一段连续素材。换句话说,生成出来的视频"动是动了,但它不知道自己动到哪一步了"。arXiv 2610.12459(WorldGuide)要解决的是真问题:让生成视频的 AI 像一个真正的"厨师"——它得先看一眼锅里的菜现在什么样,再决定下一步是放盐还是翻面。这件事,过去所有"开环"视频生成模型都做不到。
为什么这件事重要(不只给研究者看)
这件事重要,是因为"会动的 AI"是具身智能、自动驾驶、机器人、家庭助理这些赛道的底座问题。你想让机器人给你倒水,它得先看到杯子在哪儿、水倒到什么位置、是不是要停了——它得用视觉看到自己刚做完的事再决定下一步,而不是按一段写死的剧本跑完。
过去的视频生成模型(包括 Sora 类、Runway 类、可灵的工业版)有个根本缺陷:它们是"开环"的——你给它任务文字,它从头到尾生成一段轨迹,中间不回头看自己刚生成的画面。这就像让一个闭着眼的人做饭:动作再熟练,你也知道中途会出错。
更麻烦的是,长时程任务(比如"把整个厨房收拾干净",需要 30 步、跨 10 分钟)对开环模型几乎是死结——只要中间一步的画面出错了,后面 29 步的"决策"都建立在错误状态上。
WorldGuide 的切入点是闭环 + 联合训练:把"决定下一步动作"的 Planner(规划器)和"实际生成下一步画面"的 Executor(执行器)放在同一份数据上、同一套监督信号里训练。Planner 学到的"下一步要做啥"和 Executor 学到的"这一步画面长啥样",在分布上互相适应——这是它能跑通长时程程序化任务的根本原因。
它是怎么做的(人话版)
把整套系统想成一家"AI 厨房"——
角色一:大厨(Planner,规划器)——看当前画面,决定下一步动作
大厨的工作是"看锅里的菜——决定下一步是放盐、翻面、还是装盘"。它接收两样东西:①当前画面(上一秒 Executor 刚生成出来的);②任务目标("做一道番茄炒蛋")。输出是:①"下一步该做哪个原子动作"(比如"打蛋");②"任务是否已经完成"。
这是过去系统最薄弱的地方——大家要么完全省略这一步(纯开环,直接按剧本生成),要么用别人的大模型顶上去(Planner 和 Executor 训练分布不一致,经常"想的"和"做的"对不上)。WorldGuide 让 Planner 和 Executor 用同一份数据、同一套监督信号训练——这是"同源同分布"的核心。
角色二:灶台(Executor,执行器)——接收动作指令,直接生成该步画面
灶台的工作是把"动作"变成"画面"。它接收 Planner 给出的"下一步动作"指令,直接生成对应的视频片段。生成的画面会立刻被 Planner 看到,作为下一轮决策的依据。
角色三:笔记(Hierarchical Visual Memory,分层视觉记忆)——让大厨不用一直记住每一秒
长时程任务的隐患是 token 成本——如果 Planner 要看完全部历史视频才能决策,十步就要吃掉几百 MB 上下文。WorldGuide 的解法是分层压缩:把历史压成几个尺度(原始 → 几秒聚合 → 整段摘要),只把需要的层级塞给 Planner。这样 token 成本是有界的,但 Planner 仍能看到足够的视觉上下文。
三件事改变了什么
第一件:同源同分布联合训练。过去 Planner 和 Executor 各训各的——Planner 用别的大模型顶,Executor 另起炉灶;结果 Planner 想做的动作,Executor 没法生成。WorldGuide 让二者在同份数据上联合优化,从根本上解决了"想到的"和"做到的"不匹配。
第二件:自建评测基座。论文同步发布 WorldGuide-Bench——约 5.9 万步级标注 / 245 个任务 / 27 个程序类别,把"程序化视频生成"从抽象概念落到可比较的评测协议。没这套 bench,你只能看 demo;有这套 bench,你才能横向比论文。
第三件:goal-only 比 reference-plan 更强。这一点很反直觉——让 AI 只看任务目标(goal-only)的成绩,比让它看每步参考动作(reference-plan)的成绩还高。WorldGuide 在 WorldGuide-Bench 上 Task Success 33.33% vs 对照的 29.90%(对照拿了参考动作),在 VideoCraft-Bench 上 47.69% vs 32.73%。这说明"让 AI 自主看画面决定下一步"比"喂它参考答案"更有用——因为现实中没有参考答案可喂。
它在两个 benchmark 上的成绩单
| Benchmark | WorldGuide | 对照模型(MiniMax-H3) | 设置 | 备注 |
|---|---|---|---|---|
| WorldGuide-Bench | 33.33% | 29.90% | 对照拿 reference plans,WorldGuide 是 goal-only | WorldGuide 没用参考还赢了 |
| VideoCraft-Bench | 47.69% | 32.73% | 都是 goal-only | WorldGuide 领先 14.96 pp |
| 维度 | 数据 / 结论 |
|---|---|
| 自建 bench 规模 | ~5.9 万步级标注视频 / 245 任务 / 27 程序类别 |
| 论文体量 | 34 页 / 14 图 / 15 表 |
| 提交时间 | 2026-10-08 v1 |
| 第一作者 | Ankan Deria |
⚠️ abstract 里提到的对照模型代号 "MiniMax-H3" 在公开模型库暂时查不到对应名字,论文按 abstract verbatim 引用,未自行还原到任何已知模型。这一点不影响主结论——WorldGuide 在自建 bench 上首次超过强 video model,且无需 reference plans,但具体超过哪个模型,需要读 PDF 全文核验。
⚠️ 5 条边界(读这篇必须知道的坑)
- "MiniMax-H3" 代号未公开。abstract 用作对照,但 2026-10-10 公开模型库没找到这个名字,意味着"WorldGuide 超过它"这件事暂时只能信任作者自报。
- goal-only ≠ 真实人机交互。现实用户给的 goal 多半模糊("收拾一下厨房"),WorldGuide bench 上的 goal 仍是 task-level 短描述——差距还很大。
- 步级标注成本高。~5.9 万标注来自人工——每段程序视频的每个原子动作都要人标,换场景要重新打。
- Executor backbone 与 loss 未明。abstract 只说"直接训练以实现预测动作",但 video generation 用什么 loss、是否基于预训练 backbone,需要 PDF 核验。
- Hierarchical Visual Memory 实现细节为零。abstract 只说"有界 history token cost",但几级分层、压缩算法、更新规则全未给出。
对不同的人意味着什么
对具身/机器人研究者:闭环视觉世界模型是绕不开的方向。WorldGuide 给出了"Planner-Executor 联合训练"的可参考框架——想自己搭一套视觉规划系统,可以参考它的训练数据构造(同源同分布)和评估协议(WorldGuide-Bench 的步级标注思路)。
对视频生成研究者:长时程程序化生成首次有了可比基座。Demo 视频不等于论文——WorldGuide-Bench 把"看 demo 觉得厉害"变成"33.33% vs 29.90% 的可量化比较"。以后所有程序化视频生成工作都可以在这上面跑。
对 Agent / 多模态研究者:"决定下一步动作"和"实际执行下一步"应该在同一份数据上联合训练——这条思路不只适用于视频生成。任何"决策 + 视觉/音频生成"耦合场景(机器人视觉预测 + 动作生成、口语对话 + 语音生成)都可以试试"Planner-Executor 联合训练"路线。
对普通 AI 用户:未来你看到的"AI 做菜视频"会越来越真——不是因为视频生成模型更强,而是因为它开始"看自己刚生成的画面再决定下一步"了。这是从"放幻灯片"到"真做菜"的关键升级。
一句话总结
WorldGuide 把"程序化视频生成"从"按剧本放幻灯片"升级为"看到哪儿做到哪儿"的闭环任务执行,核心创新不是更大的模型,而是 Planner 和 Executor 在同一份数据上联合训练 + goal-only 比 reference-plan 更强的反直觉结论——这是视觉世界模型走向 hour-scale 长时程任务的关键一步。给所有"生成即决策"方向的研究者,提供了首个可复现评测基座 + 联合训练框架 + goal-only 评测范式的三件套。
三个标题变体
- 反直觉版(场景冲击):你看过的"AI 做菜视频"全是按剧本放的——2026 WorldGuide 把"做菜"做成了"看到哪儿做到哪儿"
- 数字钩子版:5.9 万步级标注 + 245 任务 + 27 类别——2026 WorldGuide 给"程序化视频生成"立了第一个可比较的基座
- 类比版(生活映射):传统视频生成是闭眼做饭——WorldGuide 把它升级为"开眼做饭,做完再看一眼决定下一步"
📱 小红书风格卡片文案(直接可用)
姐妹们 🫶 今天聊一个"AI 做菜视频为什么越来越真"的硬核话题!
你有没有这种感觉:刷到"AI 做菜"视频,刀工再利落、火候再精准,你心里还是嘀咕——这不是 AI 真"看到"自己在做,只是按预设脚本拍的 🫠
过去所有视频生成模型都是"开环"的:给任务文字 → 一口气生成完整轨迹 → 中间不回头看。这就是为什么你总觉得"动是动了,但它不知道自己动到哪儿了"。
arXiv 2610.12459(WorldGuide)给了一个"AI 闭环厨房"思路 🍳:
👨🍳 大厨(Planner):看当前画面,决定"下一步放盐还是翻面"——唯一的关键创新 🔥 灶台(Executor):接收大厨指令,直接生成该步画面 📒 分层视觉记忆(Hierarchical Memory):把历史压成几层,只把需要的层级塞给它——token 成本有界
为什么这件事这么重要 🌟:
1️⃣ 同源同分布联合训练:Planner 和 Executor 用同一份数据、同一套监督信号训——彻底解决"想到的"和"做到的"对不上 2️⃣ 自建 WorldGuide-Bench:5.9 万步级标注 / 245 任务 / 27 类别——第一个让"程序化视频生成"从 demo 变成可比较论文的基座 3️⃣ goal-only 比 reference-plan 更强:只给目标 > 给每步参考答案——这个反直觉结论说明"让 AI 自己看画面决定下一步"比"喂它参考答案"更有用
成绩单 📊: - WorldGuide-Bench:33.33% Task Success vs 对照 29.90%(对照拿了 reference plans) - VideoCraft-Bench:47.69% vs 32.73%(+14.96 pp) - 对照模型代号 "MiniMax-H3" 在公开模型库暂时查不到,⚠️ 按 abstract verbatim 引用
⚠️ 5 条读前必知边界 ⚠️: 1️⃣ "MiniMax-H3" 代号未公开,claim 暂只信原文 2️⃣ goal-only ≠ 真实人机交互(现实 goal 多模糊) 3️⃣ 5.9 万步级标注来自人工,换场景要重新打 4️⃣ Executor backbone 与 loss 未明,需 PDF 核验 5️⃣ 分层视觉记忆的实现细节(几级、压缩算法)全未给
给具身/Agent 研究者的最小行动项 🎯:任何"生成即动作"的方向,优先考虑 Planner-Executor 联合训练 + goal-only 评测协议——前者解决"想到做到对不上",后者让"实际可用"被独立验证。
未来你看到的 AI 视频会越来越真——不是因为模型更大,而是因为它开始"看到自己刚生成的画面再决定下一步"了 ✨
AI #视频生成 #世界模型 #Agent #具身智能 #Planner #Executor #论文解读 #arXiv #闭环系统
关联论文:2610.12459(点格式)
科普版:/shared/research-kb/organized/promo/popular/2610-12459.md