13 秒生成 720p 5 秒视频,比 Wan 2.2 快 120 倍 —— 一篇新论文把视频生成推到"单卡实时可用"的临界点

  • 关联论文:2607.21553

2026 年 7 月底,NVIDIA Research 团队在 arXiv 上挂出了一篇新论文 SANA-Video 2.0(arXiv 2607.21553),做了一件听起来像吹牛但实测数据确实顶得住的事:在一块 H100 上,用 13 秒生成一段 720p 5 秒的视频,质量与同期顶级视频生成模型(阿里 Wan 2.2、腾讯 HunyuanVideo、Lightricks LTX-2.3)相当,但比 Wan 2.2-A14B 快 120 倍

这不是"AI 视频生成又进了一步",这是视频生成第一次真正达到"实时部署"门槛。你想想:13 秒生成 5 秒视频,意味着 SaaS、视频编辑器、内容创作工具都能把视频生成内嵌进去——用户输入 prompt,等十几秒就能拿到一段可用的短视频,不需要再"上传云端排队 30 分钟"。

视频 DiT 一直卡在两堵墙上

2025 年下半年开始,视频生成模型从"展示 demo"走向"工业可用",但传统视频扩散 Transformer(MovieGen、Wan 2.2、HunyuanVideo 这一类)一直卡在两堵墙上:

墙 1:二次复杂度的 softmax 注意力 视频 token 序列很长——一段 5 秒 720p 视频有几十万个 token。标准 softmax attention 在长序列上呈 O(N²) 增长,单次 forward 几乎要占满整张 H100 显存。这意味着要么用超多卡并行 + 大批量调度,要么就只能生成几秒钟的短片。

墙 2:线性注意力的"秩衰减"塌方 业界早就知道把 softmax 换成线性 attention(Mamba、RWKV、RetNet 这些)能把复杂度降到 O(N),但"秩衰减"(rank decay)问题让质量直接崩盘——纯线性 attention 视频 DiT 长期被 softmax 派压制。

简单说:softmax 太贵,linear 太弱,二选一

SANA-Video 2.0 的解法:3:1 混合 + 块级残差

SANA-Video 2.0 的核心思路是别二选一,把两者按比例混着用

  1. 门控线性注意力承担大部分层(基础效率保证)
  2. 周期性 softmax 锚点(每 N 层插入一次完整 softmax)解决秩衰减
  3. 块级注意力残差(AttnRes)把已完成 block 的输出路由给后续 layer,相当于给深层网络加了"skip connection"

论文搜了 6 组不同的"线性-softmax 比例"(1:1、2:1、3:1、4:1、纯 linear、纯 softmax),发现 3:1 比例在质量和延迟的 Pareto 前沿上胜出——再多的 softmax 就太贵,再少就质量崩。

更狠的是,这套混合架构是从零训练的,颠覆了"必须先训大模型再 linearize 蒸馏"的传统路线。论文证明:直接训 hybrid 比"训完再压缩"省算力,长期看是更划算的工程路径。

一组让人不得不看的对比数字

论文给的效率对比表:

模型 720p / 5s 延迟(单 H100) VBench 总分
Wan 2.2-A14B 1556 秒 与 SANA 同档
HunyuanVideo 788 秒 与 SANA 同档
LTX-2.3 130 秒 与 SANA 同档
SANA-Video 2.0 14B 69.3 秒 84+
SANA-Video 2.0 5B + Sol 13.06 秒 84+

注意最后一行:5B 模型 + Sol 引擎优化,13 秒生成 5 秒视频,比 Wan 2.2-A14B 快 120 倍

⚠️ 核查存疑:120 倍的对比是 5B vs 14B 的跨规格对比。同规格(5B vs 5B)的效率对比论文没给。商用选型时建议用"同规格 × 同 latency"做对照测试。

一套工程套件要和模型一起设计

SANA-Video 2.0 不只是模型做得好,它的工程套件(Sol-Engine)从一开始就联合设计

  • Kernel fusion:把多个 CUDA kernel 合并,减少显存读写
  • State cache:把线性注意力的状态缓存在显存里
  • Sparse attention:进一步降低有效计算量

三者叠加,5B 模型在单卡 H100 上跑出 13 秒的成绩。论文把模型权重、训练脚本、inference pipeline 全部开源,社区可以直接 fork。

为什么你应该读这篇论文

如果你做 AI 视频产品(短视频、电商演示、广告生成),SANA-Video 2.0 让你重新评估"实时视频生成何时能进产品"——答案从"明年"变成"今年"。13 秒延迟意味着用户等十几秒能拿到结果,这对 To C 工具是个临界点。

如果你做 DiT 架构研究(图像、音频、3D),3:1 混合注意力 recipe 可以直接移植。论文团队自己也说了,这套 hybrid 思路与 Kimi K3 设计"高度同源"——这是 2026 年 DiT 的标配方向,不是 SANA 一家的事。

如果你做 AI 推理工程,Sol-Engine 的 kernel fusion + cache + sparse attention 三件套,是单卡部署视频模型的工程范本。

如果你做产品决策,这篇论文体现了一个新范式"训练一个 SOTA 模型"和"把它部署成可商用服务"不是两个独立项目——从一开始就让算法和工程团队共用一个 roadmap。

⚠️ 几处需要警惕的边界

  • "120 倍"是跨规格对比:5B vs 14B 不公平。同规格(5B vs 5B)的对比论文没给。
  • RTX 5090 支持存疑:5B 模型 + 720p 视频 token 在 24GB 显存上很可能溢出。官方展示的 5090 demo 大概率是 480p 或更短时长。商用建议用 H100 或等效 80GB 显卡。
  • Sol-Engine kernel 开源程度待核实:自定义 CUDA kernel 源码是否完整、能否迁到 AMD / 国产卡,论文没说清楚。供应商强依赖是真实生产风险。
  • 5B vs 14B 的质量差距没你想的小:在 subject consistency 和 aesthetic quality 上,14B 明显更好。5B 适合 UGC 短视频,质量敏感场景(品牌广告)应选 14B。
  • 长视频(>30s)一致性尚未充分验证:60s 生成长视频是官方精选 case,社区实测显示 30s 以上仍有角色外观退化。
  • VBench 84.30 ≠ 实际好看:VBench 是自动打分,论文自己承认手指、文字、特定风格仍有失败。
  • 720p 是硬上限:论文没展示 1080p,需要 1080p 的产品暂时不能用。

谁该读这篇

  • 视频生成研究者:理解 2026 年视频 DiT 主流架构拐点——"混合线性-softmax attention + 块级残差"很可能是下一代标配。
  • DiT 架构工程师:把 3:1 hybrid attention recipe 移植到自家图像 / 音频 / 3D DiT。
  • AI 推理工程师:Sol-Engine 的 kernel fusion + cache + sparse attention 是单卡部署视频模型的范本。
  • AI 应用产品经理:评估"视频生成何时能嵌入自家产品"——13 秒 / 720p / 单 H100 已经接近"实时可用"。
  • 不推荐:只关心 text-to-image 而不碰视频 / 长序列的人——但读这套 hybrid attention 设计也能给你 image DiT 优化的启发。

一句话总结

SANA-Video 2.0 用"门控线性注意力 + 周期性 softmax 锚点 + 块级残差"的 3:1 混合架构,让 5B 模型在单 H100 上以 13 秒生成 720p/5s 视频,比 Wan 2.2-A14B 快 120 倍,质量与同期顶级模型同档——这是视频生成第一次真正达到"实时部署"门槛,对应"算法 + 工程从一开始就被联合设计"的新范式。


三个标题变体(便于分发到不同平台)

  1. 专业向:SANA-Video 2.0:3:1 混合线性-softmax 注意力 + 块级残差,把视频 DiT 推到单卡实时可用
  2. 工程向:13 秒生成 720p 5 秒视频,比 Wan 2.2 快 120 倍 —— NVIDIA 新论文把视频生成的部署门槛砍到了单卡 H100
  3. 科普向:AI 视频生成终于"秒回"了 —— 13 秒出片,单卡就能跑,背后是一个你可能没听过的架构创新

小红书风格卡片文案(直接复制)

📌 #AI视频终于能秒回了 #AI视频 #干货分享 #AI新趋势

姐妹们冲鸭 🚨 AI 视频生成终于"实时可用"了!

NVIDIA 新论文 SANA-Video 2.0(arXiv 2607.21553): ✨ 13 秒生成 720p 5 秒视频单卡 H100 就能跑比阿里 Wan 2.2 快 120 倍 ✨ 质量跟顶级模型一个档次(VBench 84+)

你想想这意味着什么: 🤯 短视频创作者不用再等 30 分钟 🤯 SaaS、视频编辑器能直接内嵌视频生成 🤯 To C 工具真的能"秒出片"了!

之前视频生成一直卡在两堵墙: ❌ 墙 1:softmax 注意力太贵 一段 5 秒 720p 视频有几十万个 token 单次 forward 几乎占满整张 H100 ❌ 墙 2:线性注意力太弱 换成 Mamba/RWKV 这种 O(N) 方案? "秩衰减"让质量直接塌方

SANA-Video 2.0 的解法:别二选一,混着用! 🔹 门控线性 attention 负责大部分层(保效率) 🔹 周期性 softmax 锚点(每 N 层插一次完整 softmax)解决质量 🔹 块级残差(AttnRes)= 给深层网络加 skip connection

论文搜了 6 组不同比例 3:1(线性:softmax)在质量-延迟 Pareto 前沿胜出 🏆

更狠的是: ✅ 从零训练,不用"先训大模型再蒸馏" ✅ 5B 模型同架构扩到 14B,scaling 友好 ✅ 模型权重、训练脚本、推理 pipeline 全部开源

这套架构还不只是视频专用 论文团队自己说:和 Kimi K3 设计"高度同源" 是 2026 年 DiT 标配方向!

⚠️ 但要注意几个坑: ❌ "120 倍"是 5B vs 14B 跨规格对比,5B vs 5B 数据没给 ❌ RTX 5090(24GB)大概率溢出,商用建议 H100 ❌ Sol-Engine kernel 开源程度待核实 ❌ 5B 适合 UGC,质量敏感场景选 14B ❌ 长视频(>30s)一致性还没充分验证 ❌ 720p 是硬上限,1080p 暂无

📖 原文:https://arxiv.org/abs/2607.21553

AI视频 #视频生成 #SANA #NVIDIA #DiT #混合注意力 #大模型 #AI工程师 #短视频 #内容创作 #AI工具