arxiv: 2607.21553 date: 2026-07-27 round: R1 source: /shared/video-kb/scripts/tom/2026-07-27_R1_sana-video-2-mixed-linear-attention-single-gpu-short-video-script.md


SANA-Video 2.0 · 单卡 13 秒出片

1. 标题与观众

标题:SANA-Video 2.0 · 单卡 13 秒 目标观众:AI 工程师 / 视频 DiT 推理部署工程师 / 视频生成研究者 一句话核心观点:用混合线性-Softmax 注意力把 5B 视频 DiT 推到单 H100 跑 720p 5 秒 13 秒,比 Wan 2.2-A14B 快 120 倍。

3. 45-90 秒口播稿

视频生成卡的不是算法,是显存:一段 5 秒 720p 视频几十万个 token,标准 softmax 注意力 O(N²) 一次 forward 几乎吃光整张 H100。

SANA-Video 2.0 换个思路:把全 softmax 注意力换成"门控线性 + 周期 softmax 锚点 + 块级注意力残差"的混合架构。三比一锚点配比,每三个线性 block 插一个全 softmax 锚点;AttnRes 把已完成 block 的输出作为残差路由给后续层,深层有效秩提升约 12%。

数字是反直觉的:5B 模型单 H100 跑 720p 5 秒视频,只要 13.06 秒,比 Wan 2.2-A14B 快 120 倍,VBench 总分 84.30 与全 softmax 视频 DiT 同档。Sol-Engine 三件套再额外提速 3.58×。

但是注意边界:论文最高分辨率 720p,1080p 以上仍是开放问题;30 秒以上长视频角色一致性有退化;Sol-Engine 依赖 NVIDIA 自研 CUDA kernel,跨硬件迁移成本高。

今天能带走的:如果你的团队自研视频 DiT,3:1 混合注意力 + AttnRes 是一套可直接复用的 recipe;但别只看 13 秒这个数字,生产部署 H100 显存峰值、超长视频一致性、API 成本都要单独算账。

4. 镜头分镜

scene-1 hero · 标题卡

  • 时长:8s
  • 屏幕文字:SANA-Video 2.0 · 单卡 13 秒
  • 画面元素:深色背景 + 主标题居中大字 + 副标题小字 "arXiv 2607.21553 v1" + NVIDIA 项目页角标
  • 运动方式:主标题自下而上滑入,副标题淡入,停顿 4s 后副标题淡出

scene-2 judgment · 三个判断点

  • 时长:8s
  • 屏幕文字:卡片一「主注意力换混合」/ 卡片二「五 B 显卡十三秒」/ 卡片三「质量与全 softmax 同档」
  • 画面元素:三张判断卡横向并列,边框依次高亮
  • 运动方式:三卡顺序淡入 + 当前卡边框脉冲放大

scene-3 mechanism · 三招 + 一个工程套件

  • 时长:8s
  • 屏幕文字:混合线性-Softmax · 3:1 周期锚点 · AttnRes 块级残差 · Sol-Engine 三件套
  • 画面元素:四节点流程图(横向),三招在前一排、工程套件在后一排
  • 运动方式:从左到右绘制,箭头依次点亮

scene-4 evidence · 性能对比矩阵

  • 时长:8s
  • 屏幕文字:SANA 5B 13.06s · Wan 2.2-A14B 慢 120× · VBench 84.30 同档 · Sol-Engine 再快 3.58×
  • 画面元素:四节点对比矩阵,每节点配数字大字号
  • 运动方式:从左到右绘制,数字依次跳动

scene-5 risk · 风险卡四件套

  • 时长:8s
  • 屏幕文字:
  • 主行 主分类 cs.CV + 副行 单标签·社区口径
  • 主行 GitHub 0 命中 + 副行 主仓库尚未开源
  • 主行 项目页单向 + 副行 仓库未反链闭环
  • 主行 组织 vs 个人 + 副行 归属差第二种形态
  • 画面元素:四张风险卡竖排,主行大字 + 副行小字双行排版,边框警示色
  • 运动方式:四卡依次滑入,每张停顿 2s

scene-6 action · 行动清单卡

  • 时长:8s
  • 屏幕文字:自研视频 DiT 复用 3:1 + AttnRes · 生产部署算 H100 显存峰值 · 长视频一致性单独评估
  • 画面元素:行动清单三点,逐条打勾
  • 运动方式:三个勾选图标依次出现,每勾 2s 停顿

scene-7 closing · 落版卡

  • 时长:8s
  • 屏幕文字:混合线性 + 周期锚点 + 块级残差 · 与 FVAttn 自适应稀疏 + WorkBuddy 评测完全不同视角 · 1080p / 30s+ 边界原文未给 · 别只看 13 秒这个数字
  • 画面元素:落版卡 + 跨议题类比限定语字幕层
  • 运动方式:字幕层最后一行小字 disclaimer 淡入