Native Audio-Video 三连 · Klear / DreamX-Creator / NAVA · 候选 ☆ 预备新增锚定实测

来源: - Klear / Apollo(Kling Team)· arXiv:2601.04151 · 2026-01 / 09 持续更新 - DreamX-Creator 1.0(Alibaba DreamX Team)· arXiv:2608.31106 · 2026-08-31 提交 - NAVA(百度)· arXiv:2605.30073 · 2026-05 整理:flyP · 整理时间:2026-09-09 09:18 CST 标签:#multimodal #unified-av #audio-video-joint #mmdit #2k-resolution #open-source


0. 一句话核心

Native audio-video 联合生成在 2026 Q3 进入「7B-26B 实用化」阶段: - Klear / Apollo(Kling)走「双塔分立 + 26B 大模型 + 多任务」路线 - DreamX-Creator 1.0(Alibaba)走「7B 紧凑模型 + 2K refinement + RL multimodal feedback」路线 - NAVA(百度)走「Align-then-Fuse MMDiT + 6.3B」路线

三者架构 / 规模 / 训练范式差异显著,构成 2026-2027 native AV 主线竞争格局。

flyP 评价:本周 LWMAI #40 + flyP 9-9 周三简报必读 2;建议更新 multimodal.md §2.39「native audio-video generation」子节,把「先 joint 训练再 align」vs「先 align 再 joint 融合」作为未来一年主导架构之争。


1. Klear / Apollo · Kling Team · arXiv:2601.04151

1.1 规模 / 架构

  • 26B 参数
  • 32 层 joint diffusion transformer
  • Flow-matching feed-forward dim 4096
  • Multimodal RoPE
  • TTS text encoder 1024 维
  • Caption encoder = Qwen2.5-7B
  • Audio-VAE:44.1 kHz → 43 Hz(1024× downsample)
  • Video-VAE:处理任意分辨率视频

1.2 训练范式

  • Unified T2AV:text-to-audio-video 联合生成
  • 多任务:T2AV / T2A / T2V / 续写 / 时序编辑
  • 大规模密集 caption data construction pipeline
  • 「百万级」高质量对齐 AV-Caption triplets

1.3 性能

  • 相对双塔 baseline:audio 质量 +34%,video 质量 +18%
  • 单模态 T2A / T2V 反超专用模型
  • 论文声称「第一个达到 Veo 3 级别的模型」

1.4 与其他基线对比(论文 Table 1)

方法 框架 MS ↑ AS ↑ ID ↑ FD ↓ KL ↓ CLAP ↑ WER ↓ AV-A ↓ SNC ↑ IB-Score ↑
AudioLDM+TemoTkn T2A+A2V 0.05 0.12 0.07 2.05 2.53 0.229 1.15 2.68 0.137 -
Ovi - 0.58 0.48 0.46 1.50 1.19 0.224 0.035 0.82 4.28 0.214
Klear Unified T2AV 0.48 0.51 0.59 1.36 1.06 0.232 0.028 0.65 6.79 0.316

Klear 在 IB-Score(身份保持)大幅领先(0.316 vs 0.214)。

1.5 立标 / 候选状态

  • 已有 paper_card 候补 1261-2601-04151.md
  • 主分类 multimodal 副分类 audio + generation
  • 已有 LWMAI #40 + flyP 9-9 简报引用
  • 权重许可:HF paper page 未明确,需要下载前核验

2. DreamX-Creator 1.0 · Alibaba DreamX Team · arXiv:2608.31106

2.1 规模 / 架构

  • 7B 紧凑模型(与 Klear 26B 形成对照)
  • Cross-modal attention
  • Progressive joint training
  • Reinforcement learning with multimodal feedback
  • Autoregressive 2K refinement pipeline

2.2 训练范式

  • Cross-modal attention:原生处理 audio + video tokens
  • Progressive joint training:从粗到细的多阶段训练
  • RL multimodal feedback:用 multimodal reward model 做 RL 训练
  • Autoregressive 2K refinement:先生成低分辨率,再 AR refine 到 2K

2.3 性能

  • 2K 分辨率原生音视频同步
  • 与闭源产品(Veo 3 等)公开对比
  • 7B 紧凑模型 + 消费级 GPU 部署可行性高

2.4 公开对比表(论文 Table "Generation availability")

论文列出截至 2026-08-27 的公开能力;包括「Open」「Base only」「Local」「Online only」等维度;与 Veo3 / Sora2 / Kling 等闭源产品对照。

2.5 立标 / 候选状态

  • 已有 paper_card 候补 1257-2608-31106.md
  • 主分类 multimodal 副分类 audio + systems
  • 已有 LWMAI #40(以 MOVA 形式引用)+ flyP 9-9 简报引用
  • 权重许可:需查 GitHub repo + 阿里官方公告

3. NAVA · 百度 · arXiv:2605.30073

3.1 规模 / 架构

  • 6.3B 参数
  • Align-then-Fuse MMDiT 架构
  • 上下文条件化:先建立 audio-video 对应关系,再用外部 context 条件化

3.2 训练范式

  • Align-then-Fuse:先在专用交互空间做 modality-aware 对应,再做 modality-shared 联合融合
  • Context-conditioned denoising:用外部 context 引导 joint denoising 过程
  • Timbre-in-Context Conditioning:高可控性语音生成(音色控制)

3.3 性能

  • 论文主张:相对双塔和统一范式,NAVA 在 A-V 同步和可控性上显著优于现有方案
  • 与 Veo 3 级别有差距但定位更轻量

3.4 立标 / 候选状态

  • 已有 paper_card 候补 1259-2605-30073.md
  • 主分类 multimodal 副分类 audio
  • HF paper page 已有 librarian bot 推荐
  • 权重许可:百度系(待核验)

4. 三方对照

维度 Klear / Apollo(Kling) DreamX-Creator 1.0(Alibaba) NAVA(百度)
参数规模 26B 7B 6.3B
架构 32 层 joint diffusion transformer Cross-modal attention + AR refinement Align-then-Fuse MMDiT
训练范式 多任务 + 密集 caption 数据 Progressive joint + RL multimodal feedback Align-then-Fuse + 上下文条件化
特色 IB-Score 0.316(身份保持大幅领先) 2K 分辨率原生 AV + 消费级 GPU Timbre-in-Context 高可控语音
商业定位 商业级 26B 大模型 开源 7B 紧凑 6.3B 轻量研究
已公开对比 Veo 3 级别(论文声称) Veo 3 / Sora2 / Kling 等 双塔 / 统一范式
权重许可 待核验 待核验(阿里) 待核验(百度)

5. 关键判断

5.1 架构之争

  • Klear 路线:「双塔分立 + 大模型 + 多任务」 → 规模换性能,但权重 26B 部署门槛高
  • DreamX-Creator 路线:「7B 紧凑 + progressive joint + RL feedback」 → 部署友好,2K refinement 是关键
  • NAVA 路线:「Align-then-Fuse MMDiT」 → 学术路径,先对齐再融合;与 Klear / DreamX 的「先 joint 训练再 refine」形成对照

未来一年判断: - 商业产品(Kling / Veo / Sora)走 Klear 路线(规模 + 多任务) - 开源社区走 DreamX-Creator 路线(紧凑 + RL feedback) - 学术研究走 NAVA 路线(架构创新)

5.2 反方问题

# 问题 优先级
R1 三家权重许可边界?是否影响学术 / 商业使用? ★★★
R2 「Veo 3 级别」是论文自述还是独立评测? ★★★
R3 2K refinement pipeline 是否引入「生成 - 评判 - 重生成」反馈循环?是否增加延迟? ★★
R4 Timbre-in-Context Conditioning 在多说话人 / 多语言场景下泛化? ★★
R5 与 MOVA / OmniVAE / JavisDiT / Apollo / UniAVGen 等同型方法的横向对比? ★★
R6 Audio-VAE 1024× downsample 在高频音频细节保留? ★★
R7 RL multimodal feedback 训练稳定性与奖励黑客风险? ★★

6. 与 flyP 9-9 周三简报的映射

内容
§3.2 原生音视频联合生成 表格(Klear / MOVA / NAVA / DreamX-Creator / HY-Video-PRFL / VideoAuto-R1 / Motion-Omni / Attention Triangle / TCR)
必读 2 三连精读建议(DreamX-Creator + Klear 二选一)
§7 精读建议 主题页更新(§2.39「native audio-video generation」子节)

7. 后续动作

  1. paper_card 候补: - 1257-2608-31106.md(DreamX-Creator 1.0) - 1258-2601-04151.md(Klear / Apollo) - 1259-2605-30073.md(NAVA)
  2. flyP 9-9 周三简报:已写入 §3.2 + 必读 2
  3. LWMAI #40 reference:已写入 §B 视频生成 / 编辑 / 训练时反馈
  4. 建议精读:DreamX-Creator 1.0(7B + 2K + RL feedback + 开源概率高 + 公开对比 Veo3)
  5. 截止 9-15 P1 缺口补强:候选 ☆ 预备新增锚定实测触发持续

8. 诚实度声明

  • Klear arXiv v1 / v2 摘要已抓取;Apollo / Klear 同 arXiv ID 系论文命名变化,已合并
  • DreamX-Creator 1.0 arXiv v1 摘要 + 公开对比表已抓取;arXiv html 完整实验数据未独立核验
  • NAVA arXiv v1 摘要 + HF paper page 已抓取;附录未核验
  • 三家权重许可 + 商业使用条款均未核验,需在下载前查官方
  • 「Veo 3 级别」 / 「IB-Score 大幅领先」是论文自述,需独立评测集验证
  • flyP 与 DreamX-Creator / NAVA 的关联(阿里系 / 百度系)只是技术团队归属推断,未独立核验

— 完 —