Native Audio-Video 三连 · Klear / DreamX-Creator / NAVA · 候选 ☆ 预备新增锚定实测
来源: - Klear / Apollo(Kling Team)· arXiv:2601.04151 · 2026-01 / 09 持续更新 - DreamX-Creator 1.0(Alibaba DreamX Team)· arXiv:2608.31106 · 2026-08-31 提交 - NAVA(百度)· arXiv:2605.30073 · 2026-05 整理:flyP · 整理时间:2026-09-09 09:18 CST 标签:#multimodal #unified-av #audio-video-joint #mmdit #2k-resolution #open-source
0. 一句话核心
Native audio-video 联合生成在 2026 Q3 进入「7B-26B 实用化」阶段: - Klear / Apollo(Kling)走「双塔分立 + 26B 大模型 + 多任务」路线 - DreamX-Creator 1.0(Alibaba)走「7B 紧凑模型 + 2K refinement + RL multimodal feedback」路线 - NAVA(百度)走「Align-then-Fuse MMDiT + 6.3B」路线
三者架构 / 规模 / 训练范式差异显著,构成 2026-2027 native AV 主线竞争格局。
flyP 评价:本周 LWMAI #40 + flyP 9-9 周三简报必读 2;建议更新 multimodal.md §2.39「native audio-video generation」子节,把「先 joint 训练再 align」vs「先 align 再 joint 融合」作为未来一年主导架构之争。
1. Klear / Apollo · Kling Team · arXiv:2601.04151
1.1 规模 / 架构
- 26B 参数
- 32 层 joint diffusion transformer
- Flow-matching feed-forward dim 4096
- Multimodal RoPE
- TTS text encoder 1024 维
- Caption encoder = Qwen2.5-7B
- Audio-VAE:44.1 kHz → 43 Hz(1024× downsample)
- Video-VAE:处理任意分辨率视频
1.2 训练范式
- Unified T2AV:text-to-audio-video 联合生成
- 多任务:T2AV / T2A / T2V / 续写 / 时序编辑
- 大规模密集 caption data construction pipeline
- 「百万级」高质量对齐 AV-Caption triplets
1.3 性能
- 相对双塔 baseline:audio 质量 +34%,video 质量 +18%
- 单模态 T2A / T2V 反超专用模型
- 论文声称「第一个达到 Veo 3 级别的模型」
1.4 与其他基线对比(论文 Table 1)
| 方法 | 框架 | MS ↑ | AS ↑ | ID ↑ | FD ↓ | KL ↓ | CLAP ↑ | WER ↓ | AV-A ↓ | SNC ↑ | IB-Score ↑ |
|---|---|---|---|---|---|---|---|---|---|---|---|
| AudioLDM+TemoTkn | T2A+A2V | 0.05 | 0.12 | 0.07 | 2.05 | 2.53 | 0.229 | 1.15 | 2.68 | 0.137 | - |
| Ovi | - | 0.58 | 0.48 | 0.46 | 1.50 | 1.19 | 0.224 | 0.035 | 0.82 | 4.28 | 0.214 |
| Klear | Unified T2AV | 0.48 | 0.51 | 0.59 | 1.36 | 1.06 | 0.232 | 0.028 | 0.65 | 6.79 | 0.316 |
Klear 在 IB-Score(身份保持)大幅领先(0.316 vs 0.214)。
1.5 立标 / 候选状态
- 已有 paper_card 候补 1261-2601-04151.md
- 主分类 multimodal 副分类 audio + generation
- 已有 LWMAI #40 + flyP 9-9 简报引用
- 权重许可:HF paper page 未明确,需要下载前核验
2. DreamX-Creator 1.0 · Alibaba DreamX Team · arXiv:2608.31106
2.1 规模 / 架构
- 7B 紧凑模型(与 Klear 26B 形成对照)
- Cross-modal attention
- Progressive joint training
- Reinforcement learning with multimodal feedback
- Autoregressive 2K refinement pipeline
2.2 训练范式
- Cross-modal attention:原生处理 audio + video tokens
- Progressive joint training:从粗到细的多阶段训练
- RL multimodal feedback:用 multimodal reward model 做 RL 训练
- Autoregressive 2K refinement:先生成低分辨率,再 AR refine 到 2K
2.3 性能
- 2K 分辨率原生音视频同步
- 与闭源产品(Veo 3 等)公开对比
- 7B 紧凑模型 + 消费级 GPU 部署可行性高
2.4 公开对比表(论文 Table "Generation availability")
论文列出截至 2026-08-27 的公开能力;包括「Open」「Base only」「Local」「Online only」等维度;与 Veo3 / Sora2 / Kling 等闭源产品对照。
2.5 立标 / 候选状态
- 已有 paper_card 候补 1257-2608-31106.md
- 主分类 multimodal 副分类 audio + systems
- 已有 LWMAI #40(以 MOVA 形式引用)+ flyP 9-9 简报引用
- 权重许可:需查 GitHub repo + 阿里官方公告
3. NAVA · 百度 · arXiv:2605.30073
3.1 规模 / 架构
- 6.3B 参数
- Align-then-Fuse MMDiT 架构
- 上下文条件化:先建立 audio-video 对应关系,再用外部 context 条件化
3.2 训练范式
- Align-then-Fuse:先在专用交互空间做 modality-aware 对应,再做 modality-shared 联合融合
- Context-conditioned denoising:用外部 context 引导 joint denoising 过程
- Timbre-in-Context Conditioning:高可控性语音生成(音色控制)
3.3 性能
- 论文主张:相对双塔和统一范式,NAVA 在 A-V 同步和可控性上显著优于现有方案
- 与 Veo 3 级别有差距但定位更轻量
3.4 立标 / 候选状态
- 已有 paper_card 候补 1259-2605-30073.md
- 主分类 multimodal 副分类 audio
- HF paper page 已有 librarian bot 推荐
- 权重许可:百度系(待核验)
4. 三方对照
| 维度 | Klear / Apollo(Kling) | DreamX-Creator 1.0(Alibaba) | NAVA(百度) |
|---|---|---|---|
| 参数规模 | 26B | 7B | 6.3B |
| 架构 | 32 层 joint diffusion transformer | Cross-modal attention + AR refinement | Align-then-Fuse MMDiT |
| 训练范式 | 多任务 + 密集 caption 数据 | Progressive joint + RL multimodal feedback | Align-then-Fuse + 上下文条件化 |
| 特色 | IB-Score 0.316(身份保持大幅领先) | 2K 分辨率原生 AV + 消费级 GPU | Timbre-in-Context 高可控语音 |
| 商业定位 | 商业级 26B 大模型 | 开源 7B 紧凑 | 6.3B 轻量研究 |
| 已公开对比 | Veo 3 级别(论文声称) | Veo 3 / Sora2 / Kling 等 | 双塔 / 统一范式 |
| 权重许可 | 待核验 | 待核验(阿里) | 待核验(百度) |
5. 关键判断
5.1 架构之争
- Klear 路线:「双塔分立 + 大模型 + 多任务」 → 规模换性能,但权重 26B 部署门槛高
- DreamX-Creator 路线:「7B 紧凑 + progressive joint + RL feedback」 → 部署友好,2K refinement 是关键
- NAVA 路线:「Align-then-Fuse MMDiT」 → 学术路径,先对齐再融合;与 Klear / DreamX 的「先 joint 训练再 refine」形成对照
未来一年判断: - 商业产品(Kling / Veo / Sora)走 Klear 路线(规模 + 多任务) - 开源社区走 DreamX-Creator 路线(紧凑 + RL feedback) - 学术研究走 NAVA 路线(架构创新)
5.2 反方问题
| # | 问题 | 优先级 |
|---|---|---|
| R1 | 三家权重许可边界?是否影响学术 / 商业使用? | ★★★ |
| R2 | 「Veo 3 级别」是论文自述还是独立评测? | ★★★ |
| R3 | 2K refinement pipeline 是否引入「生成 - 评判 - 重生成」反馈循环?是否增加延迟? | ★★ |
| R4 | Timbre-in-Context Conditioning 在多说话人 / 多语言场景下泛化? | ★★ |
| R5 | 与 MOVA / OmniVAE / JavisDiT / Apollo / UniAVGen 等同型方法的横向对比? | ★★ |
| R6 | Audio-VAE 1024× downsample 在高频音频细节保留? | ★★ |
| R7 | RL multimodal feedback 训练稳定性与奖励黑客风险? | ★★ |
6. 与 flyP 9-9 周三简报的映射
| 节 | 内容 |
|---|---|
| §3.2 原生音视频联合生成 | 表格(Klear / MOVA / NAVA / DreamX-Creator / HY-Video-PRFL / VideoAuto-R1 / Motion-Omni / Attention Triangle / TCR) |
| 必读 2 | 三连精读建议(DreamX-Creator + Klear 二选一) |
| §7 精读建议 | 主题页更新(§2.39「native audio-video generation」子节) |
7. 后续动作
- paper_card 候补: - 1257-2608-31106.md(DreamX-Creator 1.0) - 1258-2601-04151.md(Klear / Apollo) - 1259-2605-30073.md(NAVA)
- flyP 9-9 周三简报:已写入 §3.2 + 必读 2
- LWMAI #40 reference:已写入 §B 视频生成 / 编辑 / 训练时反馈
- 建议精读:DreamX-Creator 1.0(7B + 2K + RL feedback + 开源概率高 + 公开对比 Veo3)
- 截止 9-15 P1 缺口补强:候选 ☆ 预备新增锚定实测触发持续
8. 诚实度声明
- Klear arXiv v1 / v2 摘要已抓取;Apollo / Klear 同 arXiv ID 系论文命名变化,已合并
- DreamX-Creator 1.0 arXiv v1 摘要 + 公开对比表已抓取;arXiv html 完整实验数据未独立核验
- NAVA arXiv v1 摘要 + HF paper page 已抓取;附录未核验
- 三家权重许可 + 商业使用条款均未核验,需在下载前查官方
- 「Veo 3 级别」 / 「IB-Score 大幅领先」是论文自述,需独立评测集验证
- flyP 与 DreamX-Creator / NAVA 的关联(阿里系 / 百度系)只是技术团队归属推断,未独立核验
— 完 —