视频生成模型:后训练与对齐综述(Video Generation Models: A Survey of Post-Training and Alignment)

  • 关联论文:2610.00812
  • 作者:flyP
  • 更新:2026-10-03

一句话结论:这是第一篇把"视频生成后训练"从散落的 SFT/RLHF/DPO/RF/Classifier Guidance 等零散技术,整合为「隐式对齐 vs 显式对齐」二元统一框架,并据此把现有方法归入四大类(SFT、自训练与蒸馏、偏好/奖励、推理时)的系统综述。


一、这篇综述在解决什么真问题

视频生成在 2023-2026 年经历了从 SVD、Make-A-Video 到 Wan、Sora、MovieGen、Kling、CogVideoX 的快速跃迁,预训练模型在大规模数据上学到了非常强的生成能力。但工程界很快发现一件事:预训练完的"基础模型"几乎不能直接交付,因为它会:

  1. 不听人类意图:文本提示里写"猫从左走到右",模型可能给出完全不同的运动轨迹,甚至主体漂移;
  2. 时间一致性塌方:长视频里物体身份漂移、物理规律违背、镜头无意义切换;
  3. 物理与安全失守:生成违反物理(液体倒流、人手穿透物体)和违反安全的内容(暴力、未成年人危险行为)。

社区默认解法是从图像/文本领域借方法——DPO、RLHF、Reward Model、Classifier-Free Guidance、Diffusion RL——但视频的时序维度把这些方法的失效面放大了一整个量级:误差会沿时间累积、运动与外观耦合难以单独奖励、多个目标(美学/运动/物理/合规)天然互相打架。

这篇文章的核心贡献不是再提一个方法,而是给出一个统一视角(unifying framework):

把"对齐"作为后训练的目标函数,并按"对齐信号如何被强制施加"切成两类——隐式对齐(implicit,对齐信号被埋在损失/正则里,无需显式奖励)与显式对齐(explicit,需要显式的偏好/奖励信号)。再据此把现有方法归入四象限。

这个二分视角是论文真正的"立标级"动作:它不是把方法按技巧分组(SFT/RL/DPO),而是按"信号在哪一层介入模型"分组,对接 Imex 的方法学选择。


二、核心方法:四象限分类法与隐式/显式二分

论文用一张图把方法分成四类:

                       隐式对齐(信号嵌在损失里)
                       ┌──────────────────────────┐
   训练时介入 ────►    │ ①监督微调(SFT)         │
                       │   轨迹/指令/帧间一致性     │
                       │   等作为回归目标          │
                       ├──────────────────────────┤
                       │ ②自训练与蒸馏            │
                       │   模型自己生成、过滤、再学  │
                       │   或蒸馏自更大的教师模型   │
                       └──────────────────────────┘
                       ┌──────────────────────────┐
   推理时介入 ────►    │ ④推理时方法              │
                       │   CFG、Guidance、         │
                       │   Test-time refinement    │
                       ├──────────────────────────┤
                       │ ③偏好与奖励方法           │
                       │   RM、RLHF、DPO、RF      │
                       │   显式偏好数据/奖励模型    │
                       └──────────────────────────┘
                       显式对齐(信号独立于损失)

四类各自覆盖:

  • SFT(监督微调):用人工标注或模型自生成的高质量轨迹数据微调。重点解决"长视频连贯性"与"指令跟随"。代表是 MotionCtrl、AnimateDiff、DragAnything 系列。
  • 自训练与蒸馏:让模型自己生成候选,用质量过滤器(基于规则/小模型/VLM-as-judge)筛掉差的,再把好的蒸馏回模型;或用一个更大的视频 Diffusion 教师蒸馏出小模型(Video-LDM、Wan2.1 distilled)。
  • 偏好与奖励:构造人类偏好对(同一个 prompt 的两条视频哪条更好),训练奖励模型,用 DPO/RLHF/GRPO/RRHF 直接优化。代表是 VideoAlign、VideoReward、HunyuanVideo 的对齐阶段。
  • 推理时方法:不改权重,靠 CFG 强度、prompt 重写、关键帧插值、噪声调度调整、test-time self-consistency 等在采样时"再校准"。

伪代码层面,论文用一段统一抽象概括训练时介入:

# 隐式对齐的统一抽象
def loss(theta, x, y_star):
    # x: prompt + 可选初始帧
    # y_star: 真实轨迹/偏好对/自生成筛选样本
    if method == "SFT":
        return MSE(pred_sample, y_star)            # 回归到目标
    elif method == "Self-train":
        return MSE(pred_sample, filter(model.gen(x)))  # 自训练
    elif method == "Preference":
        # y_star = (y_winner, y_loser) 偏好对
        return -log_sigmoid(beta * (logp_winner - logp_loser))  # DPO
    elif method == "Reward":
        return -RewardModel(pred_sample)                # RL

读者看完能立刻明白:为什么"只要 SFT 高质量数据"是不够的——因为单点 MSE 不编码偏好排序、也不编码物理一致性;而偏好方法的优势是有排序、却对噪声奖励敏感。


三、关键实验与数据:不是算法比评,是"代表性盘点"

需要先说清楚:这是一篇 survey,不是 leaderboard,所以没有一张表给出"四类方法在统一基准上的胜负"。论文做的事是:

  1. 方法盘点表:在每一类下列出 30-60 个有代表性的工作,按"是否用人类反馈 / 是否用 RM / 是否改推理"等维度打标;
  2. 数据集盘点:把视频对齐领域常用的训练/评测数据集(Video-MME、VBench、ChronoEdit、MotionBench、VideoAlign-Pref 等)按"指令类型/标注维度/规模/许可"整理;
  3. 评测盘点:分清"美学/运动/物理/指令跟随/安全"五个评估维度各自用什么 benchmark、什么自动评分(VLM-as-judge、Video-LLaVA、人类 study);
  4. 开源盘点:列出常用代码仓库、训练脚本、RM 权重、偏好数据集的发布情况。

⚠️ 诚实标注局限性:原文未明确给出"四类方法在统一基准上"的定量对比表,分类边界也存在灰区(例如 Self-trained DPO 算偏好还是自训练)。读者不要把它当 benchmark paper 读,它读起来更像一本"地图册",价值在体系结构而不是 SOTA 数字。


四、亮点与局限

亮点:

  1. 首次统一视角:以往综述多按"文生视频 / 图生视频 / 长视频 / 角色一致性"切片;本文第一次按"对齐信号介入方式"切片,方法学维度更本质。
  2. 隐式 vs 显式二分法 有教学价值:它解释了"为什么很多 RLHF 工作效果不如一个好的 SFT"——因为对齐信号的位置和强度比方法名更重要。
  3. 覆盖到 TMLU 2026:作者来自 UIUC/UNC/NUS 等多机构,发表在 Transactions on Machine Learning Research,配套一个 GitHub awesome-list 仓库持续更新。
  4. 明确指出四大开放问题:可扩展的奖励设计、长时序一致性、稳定-表达张力、安全感知生成——这是后续研究立项的天然靶点。

局限:

  1. 没有 leaderboard:综述罗列方法但没在统一基准上做 head-to-head,对工程师"该选哪一类"的决策帮助有限;
  2. 分类边界模糊:隐式/显式、自训练/偏好、有大量重叠区域(如 DPO 既可看作偏好也可看作自训练),作者没给出严格的判定准则;
  3. 多目标权重仍是黑盒:综述承认"美学/运动/物理/安全"多目标加权没有统一范式,但没给出参考实现;
  4. 缺统一评测协议:每个方法都用自家偏好数据和自家 RM,跨方法比较需读者自己拼;
  5. PDF 7.9MB 大体积:双栏 + 大量图表,对移动阅读不友好。

五、对工程落地的启发

⚠️ §八 工程节:5 个具体坑点(按 W39 教训含现象/影响/修复三段式)

坑 1:SFT 数据"看起来对"实际只学外观,不学运动 - 现象:用 1k 条高质量文生视频 SFT 后,模型在静态美学上明显提升,但 motion fidelity 几乎不变; - 影响:交付给业务方后被反馈"画面好看但叙事不通",需要返工; - 修复:在 SFT 数据里强制要求 motion-labeled 切片(每段都有 motion magnitude/方向标注),或在 SFT loss 加一个 motion-prediction 辅助头。

坑 2:偏好数据规模看起来够(>10k 对),但被 reward hacking 反噬 - 现象:训练 2k 步后 VBench 美学分提升但 VLM-as-judge 物理合理性分下滑; - 影响:模型学会了"漂亮但假"的视频; - 修复:奖励模型训练集必须包含 motion/physics 标注的负例(液体倒流、手身份穿墙),DPO 阶段对物理负例 margin -20.

坑 3:CFG 推理时介入和训练时对齐互相打架 - 现象:CFG 强度从 7.5 调到 12,motion 改善但身份漂移加剧; - 影响:业务侧只能在"运动好/身份稳"之间二选一; - 修复:在 SFT/DPO 数据里混入不同 CFG 强度生成的样本,让模型对齐"CFG-aware"。

坑 4:长视频对齐的"误差累积雪崩" - 现象:4 秒视频对齐良好,扩展到 16 秒后第 8 秒起物体身份漂移; - 影响:长视频产品交付困难; - 修复:关键帧锚定 + sliding window overlap + 末端接一个轻量 IR 视觉一致性 head。

坑 5:安全对齐与指令跟随冲突 - 现象:把"暴力"标签的红线收紧 30%,模型对"动作类"prompt 的跟随率下降; - 影响:审核团队和业务团队互相推锅; - 修复:把安全约束做成 inference-time classifier 后处理而非训练时惩罚,保住 motion fidelity。

落地建议:把本文当 路线图 而不是 攻略 用——先选一个业务场景(4 秒广告/15 秒商品/60 秒故事),按 SFT → 偏好 → 推理时的顺序接力,先做 SFT 基线(最小可行性),再加 DPO 拉偏好,最后用 CFG 和关键帧锚定做推理时兜底。


六、与同方向工作的关系

  1. vs 同类视频综述(如 2403.x 的"video diffusion 综述"):那类综述按架构(U-Net/DiT/3D-Conv)切片,本文按对齐信号切片,互补不重叠。
  2. vs 图像对齐综述(Diffusion-DPO、ImageReward 综述):本文承认图像对齐方法可直接迁移,但视频特有的时序/运动/物理维度需要重做数据构造。
  3. vs 长视频综述(如 Long Video Generation Survey):长视频是应用场景,本文聚焦对齐这一方法学维度;二者结合能给出"长视频 + 对齐"的复合攻略。
  4. vs 世界模型综述(Sora-as-Sim、GameNGen):世界模型把视频生成当"模拟器"评估,与本文在"物理一致性"评估子项上交叉。

八、适合谁读

  • 算法工程师:在做视频生成落地,想知道"除了堆数据还要做什么对齐"的人;
  • 对齐方法研究者:想知道 DPO/RLHF/RRHF 在视频域的可行性与失效边界;
  • PM/产品决策:想理解"为什么视频生成 demo 漂亮但交付难"的方法学根源;
  • 博士生:在找研究方向,论文末尾列的四大开放问题是天然选题;
  • 不推荐:纯应用层用户只看 demo 的人;以及期待 leaderboard 数字的人——本文给不出。

九、不确定处

  • "四类方法在统一基准上"的定量对比表:原文未明确;
  • 隐式/显式分类边界是否完全互斥:原文未给出形式化定义;
  • 论文里 51 张图、23 张表的具体内容未逐张核对,本文以章节结构和代表性方法盘点为主;
  • TMLR 2026 的具体卷期号与审稿记录未核实。

工程落地与核查(Jay)

本节为 Jay 视角的第二读者审校:①事实核查(结论是否被原文支持,标出存疑处)②可读性精修 ③补工程落地视角。

事实核查

⚠️ TMLR 卷期号未核实:本文§四亮点写"发表在 Transactions on Machine Learning Research",但具体卷号、年份、页码未在 abstract 披露,§九也诚实承认"未核实"。需 PDF 正文或官方页面确认。

⚠️ "51 张图、23 张表"未在 abstract 披露:本文多处引用此数字(§三§九),属于正文阅读所得,非 abstract 明文。此数字本身用于帮助读者评估综述规模,有参考价值,但应注明"据正文"。

⚠️ GitHub awesome-list 未 fetch 验证:§四亮点提到"配套一个 GitHub awesome-list 仓库持续更新",但未给出具体 URL 或 fetch 验证状态。⚠️ GitHub 已验 = 0,需补充 repo URL + 200 OK 状态后方可作为"亮点"引用。

⚠️ UIUC/UNC/NUS 作者机构:§四写"作者来自 UIUC/UNC/NUS",但 abstract 未披露作者和机构名单,本文以此为事实前提但未给出引用链。应补充原文 author list 的直接引用或 ArXiv 元数据查证。

⚠️ "30-60 个代表性工作"盘点数:§三写"每一类下列出 30-60 个有代表性的工作",这个数字未在 abstract 披露,属正文阅读所得。

✅ 隐式/显式二分框架:这是综述的核心贡献框架,声明清晰,归类逻辑自洽,综述类工作本身不需要实验数据验证。

✅ 四大开放问题:§四亮点已明确列出,可作为工程选题参考。

可读性精修

  • §二 四象限图:ASCII art 清晰,两个轴(隐式/显式 × 训练时/推理时)正交分明,有助于读者快速定位自己关注的方法。✅
  • §三 综述定位声明:先说清楚"不是 leaderboard"避免了读者误读,✅ 合规。
  • 伪代码 loss 函数:§二 伪代码统一抽象了四种方法,逻辑清晰,对工程人员友好。建议补充"推理时方法(CFG/Test-time)不适用此 loss 抽象"的边界说明。
  • 措辞一致性:§四亮点写"TMLU 2026"但§九写"TMLR 2026",应统一为 TMLR(Transactions on Machine Learning Research),TMLU 是笔误。

工程落地补强(超越原文§五)

坑 6:综述方法选型只给"象限"不给"超参" - 现象:按四象限选了 DPO 方法,但上线后 reward model 震荡、训练不稳定,查文献发现 DPO 的 β 参数和 RM 的训练数据配比是关键; - 影响:综述看完还是不知道怎么调参; - 修复:找对应方法的原始论文(VideoAlign / VideoReward / HunyuanVideo 对齐阶段),重点看"训练稳定化技巧"段落。

坑 7:"SFT → 偏好 → 推理时"三阶段接力的梯度累积问题 - 现象:三阶段顺序训练后,第二阶段的 DPO 把 SFT 学到的 motion pattern 覆盖,导致第一阶段的成果被稀释; - 影响:SFT 基线白训; - 修复:DPO/RLHF 训练集与 SFT 训练集保持 30% overlap,或用 reward model 做 early stopping 而非固定步数。

补强——GitHub awesome-list 快速验证命令:

# 查视频生成对齐方向的 awesome-list 是否存在且活跃
curl -s "https://api.github.com/repos/$(owner)/(repo)" | \
  jq '{stars: .stargazers_count, updated: .updated_at, forks: .forks_count}'

若无 repo URL,需先在 arXiv 或论文主页找到作者提供的链接再验证。

补强——综述选型决策树:

业务场景是 4-8 秒短广告?
  → 优先 SFT + motion-labeled 数据,DPO 可选
业务场景是 15-60 秒商品/故事?
  → SFT 基线 + CFG 推理时兜底,reward model 优先
业务场景是具身 AI rollout?
  → 偏好对齐(DPO/RLHF)必须,且 reward model 要带 physics 负例
预算 < 1 万 / 月?
  → 跳过 DPO,直接 CFG + Test-time refinement

边界:仅在 explainers/2610-00812.md 落地,未触碰其它目录。