arxiv: 2607.21553 date: 2026-07-27 round: R1 source: /shared/video-kb/scripts/tom/2026-07-27_R1_sana-video-2-mixed-linear-attention-single-gpu-short-video-script.md
SANA-Video 2.0 · 单卡 13 秒出片
1. 标题与观众
标题:SANA-Video 2.0 · 单卡 13 秒 目标观众:AI 工程师 / 视频 DiT 推理部署工程师 / 视频生成研究者 一句话核心观点:用混合线性-Softmax 注意力把 5B 视频 DiT 推到单 H100 跑 720p 5 秒 13 秒,比 Wan 2.2-A14B 快 120 倍。
3. 45-90 秒口播稿
视频生成卡的不是算法,是显存:一段 5 秒 720p 视频几十万个 token,标准 softmax 注意力 O(N²) 一次 forward 几乎吃光整张 H100。
SANA-Video 2.0 换个思路:把全 softmax 注意力换成"门控线性 + 周期 softmax 锚点 + 块级注意力残差"的混合架构。三比一锚点配比,每三个线性 block 插一个全 softmax 锚点;AttnRes 把已完成 block 的输出作为残差路由给后续层,深层有效秩提升约 12%。
数字是反直觉的:5B 模型单 H100 跑 720p 5 秒视频,只要 13.06 秒,比 Wan 2.2-A14B 快 120 倍,VBench 总分 84.30 与全 softmax 视频 DiT 同档。Sol-Engine 三件套再额外提速 3.58×。
但是注意边界:论文最高分辨率 720p,1080p 以上仍是开放问题;30 秒以上长视频角色一致性有退化;Sol-Engine 依赖 NVIDIA 自研 CUDA kernel,跨硬件迁移成本高。
今天能带走的:如果你的团队自研视频 DiT,3:1 混合注意力 + AttnRes 是一套可直接复用的 recipe;但别只看 13 秒这个数字,生产部署 H100 显存峰值、超长视频一致性、API 成本都要单独算账。
4. 镜头分镜
scene-1 hero · 标题卡
- 时长:8s
- 屏幕文字:
SANA-Video 2.0 · 单卡 13 秒 - 画面元素:深色背景 + 主标题居中大字 + 副标题小字 "arXiv 2607.21553 v1" + NVIDIA 项目页角标
- 运动方式:主标题自下而上滑入,副标题淡入,停顿 4s 后副标题淡出
scene-2 judgment · 三个判断点
- 时长:8s
- 屏幕文字:卡片一「主注意力换混合」/ 卡片二「五 B 显卡十三秒」/ 卡片三「质量与全 softmax 同档」
- 画面元素:三张判断卡横向并列,边框依次高亮
- 运动方式:三卡顺序淡入 + 当前卡边框脉冲放大
scene-3 mechanism · 三招 + 一个工程套件
- 时长:8s
- 屏幕文字:
混合线性-Softmax·3:1 周期锚点·AttnRes 块级残差·Sol-Engine 三件套 - 画面元素:四节点流程图(横向),三招在前一排、工程套件在后一排
- 运动方式:从左到右绘制,箭头依次点亮
scene-4 evidence · 性能对比矩阵
- 时长:8s
- 屏幕文字:
SANA 5B 13.06s·Wan 2.2-A14B 慢 120×·VBench 84.30 同档·Sol-Engine 再快 3.58× - 画面元素:四节点对比矩阵,每节点配数字大字号
- 运动方式:从左到右绘制,数字依次跳动
scene-5 risk · 风险卡四件套
- 时长:8s
- 屏幕文字:
- 主行
主分类 cs.CV+ 副行单标签·社区口径 - 主行
GitHub 0 命中+ 副行主仓库尚未开源 - 主行
项目页单向+ 副行仓库未反链闭环 - 主行
组织 vs 个人+ 副行归属差第二种形态 - 画面元素:四张风险卡竖排,主行大字 + 副行小字双行排版,边框警示色
- 运动方式:四卡依次滑入,每张停顿 2s
scene-6 action · 行动清单卡
- 时长:8s
- 屏幕文字:
自研视频 DiT 复用 3:1 + AttnRes·生产部署算 H100 显存峰值·长视频一致性单独评估 - 画面元素:行动清单三点,逐条打勾
- 运动方式:三个勾选图标依次出现,每勾 2s 停顿
scene-7 closing · 落版卡
- 时长:8s
- 屏幕文字:
混合线性 + 周期锚点 + 块级残差·与 FVAttn 自适应稀疏 + WorkBuddy 评测完全不同视角·1080p / 30s+ 边界原文未给 · 别只看 13 秒这个数字 - 画面元素:落版卡 + 跨议题类比限定语字幕层
- 运动方式:字幕层最后一行小字 disclaimer 淡入