date: 2026-08-09 round: R2 arxiv: https://arxiv.org/abs/2608.05798 video-kb: /shared/video-kb/scripts/tom/2026-08-09_R2_kvae-tokenizer-family-multimodal-short-video-script.md
1. 标题与观众
- 标题:KVAE 多模态 tokenizer 升一档
- 目标观众:AI 工程师 / 扩散模型 / 多模态 tokenizer 工程师
- 一句话核心观点:把音频 / 3D / 图像 tokenizer 升级为可独立评测的一等组件,跨模态对齐开源 SOTA。
3. 45-90 秒口播稿
扩散模型的画质天花板其实在 tokenizer 潜在空间是后续扩散的学习基底 Kandinsky Lab 把这件事拆开看了 他们发了 KVAE 家族三件套 KVAE-Audio 处理 48kHz 音频 50Hz latent · 64 通道 KVAE-3D 是 4×16×16 因果视频 KVAE-2D 是 8× 压缩 · 32 通道 PSNR / LPIPS / PESQ 对齐开源 SOTA 对照 Wan-2.2 · HunyuanVideo-1.5 对照 FLUX.2 · MovieGen · MMAudio 单 model 单任务 复测还没公开 选型前先建 tokenizer 评测 pipeline
4. 镜头分镜
- 镜头 1(0-8s · 标题卡):
- 屏幕文字:
KVAE · 多模态 tokenizer - kicker:
跨模态统一评测 SOTA - 画面元素:主标题卡 + KVAE 三件套 logo 并列
- 运动方式:镜头静态 + 文字逐字淡入
- 镜头 2(8-16s · 三件套并列卡片):
- 屏幕文字:
KVAE-Audio · 48kHz - 屏幕文字:
50Hz latent · 64 通道 - 屏幕文字:
KVAE-3D · 4×16×16 因果 - 屏幕文字:
KVAE-2D · 8× · 32 通道 - 画面元素:三件套卡片从上至下并列
- 运动方式:卡片依次淡入
- 镜头 3(16-26s · 跨模态评测表):
- 屏幕文字:
PSNR · LPIPS · PESQ - 屏幕文字:
Frechet · CLIP · CLAP - 屏幕文字:
对齐开源 SOTA - 屏幕文字:
Wan-2.2 · HunyuanVideo - 屏幕文字:
FLUX.2 · MovieGen - 屏幕文字:
StableAudio · MMAudio - 画面元素:评测表 + 6 个 SOTA 对照组 logo
- 运动方式:表格行依次高亮
- 镜头 4(26-34s · 重建链路流程图):
- 屏幕文字:
重建误差 → 潜空间偏置 - 屏幕文字:
误差传到扩散生成端 - 画面元素:三节点链路图(tokenizer → 潜空间 → 扩散)
- 运动方式:箭头逐段填充
- 镜头 5(34-42s · 风险限定卡):
- 屏幕文字:
单 model · 单任务 - 屏幕文字:
跨硬件不保证 - 屏幕文字:
维护性未量化 - 屏幕文字:
客观 vs 主观 gap - 屏幕文字:
预印本未复现 - 屏幕文字:
跨 GPU 效果差异未量化 - 画面元素:7 条风险限定条目
- 运动方式:逐条淡入
- 镜头 6(42-50s · 行动清单):
- 屏幕文字:
选型前必做三件诊断 - 屏幕文字:
生成端评测 - 屏幕文字:
跨模态统一协议 - 屏幕文字:
训练细节公开度 - 画面元素:三步清单
- 运动方式:步骤依次亮起
- 镜头 7(50-60s · 收束卡):
- 屏幕文字:
重建 + 生成两套评测 - 屏幕文字:
可复现性优先 - 屏幕文字:
tokenizer 是基础组件 - 画面元素:收束卡 + KVAE GitHub URL
- 运动方式:镜头缓推 + 文字淡出