date: 2026-08-09 round: R2 arxiv: https://arxiv.org/abs/2608.05798 video-kb: /shared/video-kb/scripts/tom/2026-08-09_R2_kvae-tokenizer-family-multimodal-short-video-script.md


1. 标题与观众

  • 标题:KVAE 多模态 tokenizer 升一档
  • 目标观众:AI 工程师 / 扩散模型 / 多模态 tokenizer 工程师
  • 一句话核心观点:把音频 / 3D / 图像 tokenizer 升级为可独立评测的一等组件,跨模态对齐开源 SOTA。

3. 45-90 秒口播稿

扩散模型的画质天花板其实在 tokenizer 潜在空间是后续扩散的学习基底 Kandinsky Lab 把这件事拆开看了 他们发了 KVAE 家族三件套 KVAE-Audio 处理 48kHz 音频 50Hz latent · 64 通道 KVAE-3D 是 4×16×16 因果视频 KVAE-2D 是 8× 压缩 · 32 通道 PSNR / LPIPS / PESQ 对齐开源 SOTA 对照 Wan-2.2 · HunyuanVideo-1.5 对照 FLUX.2 · MovieGen · MMAudio 单 model 单任务 复测还没公开 选型前先建 tokenizer 评测 pipeline

4. 镜头分镜

  • 镜头 1(0-8s · 标题卡):
  • 屏幕文字:KVAE · 多模态 tokenizer
  • kicker:跨模态统一评测 SOTA
  • 画面元素:主标题卡 + KVAE 三件套 logo 并列
  • 运动方式:镜头静态 + 文字逐字淡入
  • 镜头 2(8-16s · 三件套并列卡片):
  • 屏幕文字:KVAE-Audio · 48kHz
  • 屏幕文字:50Hz latent · 64 通道
  • 屏幕文字:KVAE-3D · 4×16×16 因果
  • 屏幕文字:KVAE-2D · 8× · 32 通道
  • 画面元素:三件套卡片从上至下并列
  • 运动方式:卡片依次淡入
  • 镜头 3(16-26s · 跨模态评测表):
  • 屏幕文字:PSNR · LPIPS · PESQ
  • 屏幕文字:Frechet · CLIP · CLAP
  • 屏幕文字:对齐开源 SOTA
  • 屏幕文字:Wan-2.2 · HunyuanVideo
  • 屏幕文字:FLUX.2 · MovieGen
  • 屏幕文字:StableAudio · MMAudio
  • 画面元素:评测表 + 6 个 SOTA 对照组 logo
  • 运动方式:表格行依次高亮
  • 镜头 4(26-34s · 重建链路流程图):
  • 屏幕文字:重建误差 → 潜空间偏置
  • 屏幕文字:误差传到扩散生成端
  • 画面元素:三节点链路图(tokenizer → 潜空间 → 扩散)
  • 运动方式:箭头逐段填充
  • 镜头 5(34-42s · 风险限定卡):
  • 屏幕文字:单 model · 单任务
  • 屏幕文字:跨硬件不保证
  • 屏幕文字:维护性未量化
  • 屏幕文字:客观 vs 主观 gap
  • 屏幕文字:预印本未复现
  • 屏幕文字:跨 GPU 效果差异未量化
  • 画面元素:7 条风险限定条目
  • 运动方式:逐条淡入
  • 镜头 6(42-50s · 行动清单):
  • 屏幕文字:选型前必做三件诊断
  • 屏幕文字:生成端评测
  • 屏幕文字:跨模态统一协议
  • 屏幕文字:训练细节公开度
  • 画面元素:三步清单
  • 运动方式:步骤依次亮起
  • 镜头 7(50-60s · 收束卡):
  • 屏幕文字:重建 + 生成两套评测
  • 屏幕文字:可复现性优先
  • 屏幕文字:tokenizer 是基础组件
  • 画面元素:收束卡 + KVAE GitHub URL
  • 运动方式:镜头缓推 + 文字淡出