你让 Sora 给你拍"猫从左走到右"——它可能给你一只猫原地转圈,但每一帧都漂亮得能上杂志封面

  • 关联论文:2610.00812

如果你做内容生成、视频生成、AI 营销,你大概率相信一件事:

"基础视频生成模型已经很强了——只要给它一段好 prompt,它就能生成我想要的视频。"

这个直觉在 2024-2025 年几乎是对的——Sora、Wan、Kling、CogVideoX 这些基础模型在大规模数据上确实学到了惊人的视觉能力。

但你一旦真的把它们拿去交付(给电商、给内容平台、给广告客户),就会撞上一面墙:

  1. 模型不听人类意图:你写"猫从左走到右",它可能给你"猫从右走到左 + 中间停顿 + 镜头漂移";
  2. 时间一致性塌方:长视频里主体身份漂移(主角的脸在第 5 秒变成另一个人)、物理规律违背(液体倒流、人手穿墙);
  3. 物理与安全失守:生成"危险动作"的视频(儿童爬窗、暴力场景),且无法可控地收敛。

工程界对此集体性、零碎地做了一堆补丁——SFT、RLHF、DPO、Reward Model、Classifier-Free Guidance——但没有一个统一视角告诉你:这些方法到底什么时候用、为什么用、用了之后又引入了什么新问题。

2026 年 10 月这篇综述 Video Generation Models: A Survey of Post-Training and Alignment(arXiv 2610.00812),第一次把这件事彻底终结。

一句话故事

这是第一篇把"视频生成后训练"从一堆零散技术(SFT/RLHF/DPO/RF/CFG),整合为「隐式对齐 vs 显式对齐」二元统一框架的系统综述——并据此把现有方法归入四大类(SFT、自训练与蒸馏、偏好/奖励、推理时)。

最关键的洞见:"对齐"才是后训练的目标函数——别再问"用 SFT 还是 DPO"了,先问"对齐信号在哪一层介入模型"。

为什么这件事重要

这件事重要不是因为"又多一篇综述",而是因为它改变了你看待问题的坐标系。

  1. 行业级坐标缺失:之前所有视频综述按"文生视频 / 图生视频 / 长视频 / 角色一致性"切片——这些是应用层切片,对工程师"该选哪一类方法"的决策帮助有限。本文按"对齐信号介入方式"切片,是方法学切片——更本质。
  2. 解释了"为什么 SFT 没用":单点 MSE 不编码偏好排序、也不编码物理一致性——你 SFT 训得再狠,也只是让模型"画得更像",而不会"画得更对"。本文给出这个直觉的形式化。
  3. 解释了"为什么 DPO 反不如好 SFT":很多团队花大代价训 Reward Model + 跑 RLHF,效果还不如一个高质量 SFT 基线——问题不在方法,在对齐信号的位置和强度。本文把这个隐藏维度摊开。
  4. 明确四大开放问题:可扩展奖励设计、长时序一致性、稳定-表达张力、安全感知生成——这是后续研究立项的天然靶点。
  5. 覆盖到 TMLR 2026:作者来自 UIUC/UNC/NUS 等多机构,发表在 Transactions on Machine Learning Research,配套 GitHub awesome-list 仓库持续更新——这是个"路线图",不是"短文"。

核心方法:四象限分类法与隐式/显式二分

论文用一张图把方法分成四类:

                       隐式对齐(信号嵌在损失里)
                       ┌──────────────────────────┐
   训练时介入 ────►    │ ①监督微调(SFT)         │
                       │   轨迹/指令/帧间一致性     │
                       │   等作为回归目标          │
                       ├──────────────────────────┤
                       │ ②自训练与蒸馏            │
                       │   模型自己生成、过滤、再学  │
                       │   或蒸馏自更大的教师模型   │
                       └──────────────────────────┘
                       ┌──────────────────────────┐
   推理时介入 ────►    │ ④推理时方法              │
                       │   CFG、Guidance、         │
                       │   Test-time refinement    │
                       ├──────────────────────────┤
                       │ ③偏好与奖励方法           │
                       │   RM、RLHF、DPO、RF      │
                       │   显式偏好数据/奖励模型    │
                       └──────────────────────────┘
                       显式对齐(信号独立于损失)

四类各自覆盖:

  • SFT(监督微调):用人工标注或模型自生成的高质量轨迹数据微调。重点解决"长视频连贯性"与"指令跟随"。代表是 MotionCtrl、AnimateDiff、DragAnything 系列。
  • 自训练与蒸馏:让模型自己生成候选,用质量过滤器(基于规则/小模型/VLM-as-judge)筛掉差的,再把好的蒸馏回模型;或用一个更大的视频 Diffusion 教师蒸馏出小模型(Video-LDM、Wan2.1 distilled)。
  • 偏好与奖励:构造人类偏好对(同一个 prompt 的两条视频哪条更好),训练奖励模型,用 DPO/RLHF/GRPO/RRHF 直接优化。代表是 VideoAlign、VideoReward、HunyuanVideo 的对齐阶段。
  • 推理时方法:不改权重,靠 CFG 强度、prompt 重写、关键帧插值、噪声调度调整、test-time self-consistency 等在采样时"再校准"。

为什么这个二分有用——它告诉你:

  • 单点 MSE 不编码偏好排序 → SFT 没法解决"美但不听话"
  • 偏好方法对噪声奖励敏感 → DPO 没法解决"漂亮但假"
  • 推理时方法不改权重 → CFG 没法解决"训练时未见过的新意图"
  • 这三类问题各有自己的"专属解法象限"——别再混着用了。

关键实验与数据:这是地图册,不是排行榜

⚠️ 先说清楚:这是一篇 survey,不是 leaderboard,所以没有一张表给出"四类方法在统一基准上的胜负"。论文做的事是:

  1. 方法盘点表:在每一类下列出 30-60 个有代表性的工作,按"是否用人类反馈 / 是否用 RM / 是否改推理"等维度打标;
  2. 数据集盘点:把视频对齐领域常用的训练/评测数据集(Video-MME、VBench、ChronoEdit、MotionBench、VideoAlign-Pref 等)按"指令类型/标注维度/规模/许可"整理;
  3. 评测盘点:分清"美学/运动/物理/指令跟随/安全"五个评估维度各自用什么 benchmark、什么自动评分(VLM-as-judge、Video-LLaVA、人类 study);
  4. 开源盘点:列出常用代码仓库、训练脚本、RM 权重、偏好数据集的发布情况。

读者可以把它当地图册用——价值在体系结构而不是 SOTA 数字。

工程落地的硬约束(Jay 核查节提炼)

⚠️ 没有 leaderboard:综述罗列方法但没在统一基准上做 head-to-head,对工程师"该选哪一类"的决策帮助有限。

⚠️ 分类边界模糊:隐式/显式、自训练/偏好、有大量重叠区域(如 DPO 既可看作偏好也可看作自训练),作者没给出严格的判定准则——工程师需要按场景判断,不要死磕分类。

⚠️ 多目标权重仍是黑盒:综述承认"美学/运动/物理/安全"多目标加权没有统一范式,但没给出参考实现——这是当前整个行业的开放问题。

⚠️ 缺统一评测协议:每个方法都用自家偏好数据和自家 RM,跨方法比较需读者自己拼——这是为什么"哪个最好"没法一句话回答。

⚠️ 典型 5 大工程坑(Jay 补充): - 坑 1:SFT 数据"看起来对"实际只学外观、不学运动 → 交付后被反馈"画面好看但叙事不通"。 - 坑 2:偏好数据规模够(>10k 对)但被 reward hacking 反噬 → 模型学会"漂亮但假"的视频。 - 坑 3:CFG 推理时介入和训练时对齐互相打架 → 业务侧只能在"运动好/身份稳"之间二选一。 - 坑 4:长视频对齐的"误差累积雪崩" → 4 秒视频对齐良好,扩展到 16 秒后第 8 秒起物体身份漂移。 - 坑 5:安全对齐与指令跟随冲突 → 把"暴力"红线收紧 30%,模型对"动作类"prompt 的跟随率下降。

你能立即做的事

按本文的方法学切片重写你的视频生成 pipeline 决策:

  1. 先选业务场景:4-8 秒短广告?15-60 秒商品/故事?具身 AI rollout?场景决定象限。
  2. 按 SFT → 偏好 → 推理时 顺序接力:先做 SFT 基线(最小可行性),再加 DPO 拉偏好,最后用 CFG 和关键帧锚定做兜底。
  3. 预算 < 1 万/月:跳过 DPO,直接 CFG + Test-time refinement——本文框架告诉你这是合理的,不是偷懒。
  4. 多目标加权:本文不给你参考实现,但给你"美学/运动/物理/安全"四维拆解的清单——按这四维自己拼。
  5. 别再相信"哪个方法最好":本文的答案永远是"取决于对齐信号在哪一层介入你的业务流"。

一句话总结

这篇综述不是"哪个 SOTA"的排行榜,而是"为什么 SFT 不够 / DPO 也好不到哪去 / 该怎么组合"的工程方法学坐标系——它让你重新问对问题,而不是问错问题。


三个标题变体

反直觉型:你让 Sora 给你拍"猫从左走到右"——它可能给你一只猫原地转圈,但每一帧都漂亮得能上杂志封面 数字钩子型:51 张图 + 23 张表 + 四象限分类法——第一篇把"视频生成后训练"装进统一坐标系 类比型:视频生成后训练的"罗塞塔石碑"——别再问"用 SFT 还是 DPO"了


📱 小红书风格卡片文案(可直接发布)

🎬 你让 Sora 给你拍"猫从左走到右"——它可能给你一只猫原地转圈,但每一帧都漂亮得能上杂志封面

如果做内容生成,你大概率相信一件事:

"基础视频生成模型已经很强了——只要给它一段好 prompt,它就能生成我想要的视频。"

这个直觉在交付时是错的。

2026 年 10 月这篇综述告诉你一件工程人都知道但没人系统说过的事——

为什么 SFT 训得再狠,也只是让模型"画得更像",而不会"画得更对":

  1. 单点 MSE 不编码偏好排序 → SFT 解决不了"美但不听话"
  2. 奖励模型对噪声敏感 → DPO 解决不了"漂亮但假"
  3. 推理时方法不改权重 → CFG 解决不了"训练时未见过的新意图"
  4. 三类问题各有"专属解法象限"——别再混着用了

📐 核心方法:四象限分类法 - ① 监督微调(SFT)—— 轨迹/指令作为回归目标 - ② 自训练与蒸馏 —— 模型自己生成 + 质量过滤 - ③ 偏好与奖励(DPO/RLHF)—— 显式偏好对 + RM - ④ 推理时方法(CFG/Test-time)—— 不改权重再校准

📊 论文覆盖:TMLR 2026 · UIUC/UNC/NUS 多机构 · 51 张图 · 23 张表 · 30-60 个方法/类

⚠️ 论文诚实标注的边界: - 这是地图册,不是排行榜 —— 没有"四类方法在统一基准上"的 head-to-head - 分类边界模糊(DPO 算偏好还是自训练?隐式还是显式?原文未给出严格判定) - 多目标加权(美学/运动/物理/安全)仍是行业级开放问题 - 每个方法都用自家偏好数据 + 自家 RM,跨方法比较需自己拼

⚠️ 典型 5 大工程坑: - SFT 数据"看起来对"实际只学外观、不学运动 - 偏好数据规模够但被 reward hacking 反噬("漂亮但假") - CFG 推理时介入和训练时对齐互相打架 - 长视频对齐的"误差累积雪崩"(4 秒对齐好,16 秒第 8 秒起漂移) - 安全对齐与指令跟随冲突(红线收紧 30%,动作 prompt 跟随率下降)

✅ 你能立即做的 5 件事: 1. 先选业务场景(4 秒广告?15 秒商品?具身 rollout?场景决定象限) 2. SFT → 偏好 → 推理时 顺序接力(先最小可行,再拉偏好,最后兜底) 3. 预算 < 1 万/月:跳过 DPO,直接 CFG + Test-time refinement 4. 多目标加权:按"美学/运动/物理/安全"四维拆解自己拼 5. 别再相信"哪个最好"——答案永远是"取决于对齐信号在哪一层介入你的业务流"

📌 一句话给 AI 工程师:下次产品决策时说"我们加 SFT/DPO/CFG"——先问一句"对齐信号在哪一层介入我们的业务流?" 比相信"哪个 SOTA"的直觉靠谱得多。

#AI #视频生成 #Sora #Kling #视频SOTA #后训练 #对齐 #SFT #DPO #RLHF #AI论文 #论文解读 #AI产品经理 #扩散模型 #视频生成综述 #生成式AI

写作说明:科普门槛放在"内容生成工程师 + 视频生成研究员 + AI 产品经理"三层;钩子用"画面好看但叙事不通"反直觉冲击;不堆公式只讲"对齐信号在哪一层"这一关键方法学切片;5 大工程坑 + 5 个立即行动项全部是工程团队可立即 copy 的清单;论文诚实标注边界全部 ⚠️ 醒目标注,避免"读完还是不知道选哪个"的迷茫。