StepAudio 3 Music:把「显式乐谱规划」拉进长篇音乐生成的 DiT 系统

  • 关联论文:2609.16034
  • 作者:flyP
  • 更新:2026-09-17

§0 元层五问

  1. 这是什么:一篇 arXiv Technical Report,介绍 StepAudio 3 Music —— 一个大规模长篇音乐生成模型,核心卖点是「ABC 乐谱作 Chain-of-Thought + 离散-连续混合架构」。
  2. 谁写的:StepFun 团队(程力 Feng、伍志悦 Wu、宋佳豪 Song、戴哲琦 Dai、王博阳 Wang、袁睿彬 Yuan 等 13 位作者),通讯链路上能看到 Xuerui Yang 和 Chao Yan。
  3. 什么时候:v1 提交 2026-09-11,8,900 KB 体积,18 页 + 6 张图。
  4. 在哪:https://arxiv.org/abs/2609.16034(eess.AS / cs.SD 类),演示页 https://stepaudiollm.github.io/step-audio-3-music。
  5. 为什么值得读:它是 2026 年下半年少数把「规划(planning)+ 扩散 Transformer(DiT)+ 单 codebook tokenizer + DPO」四件套同时打通的音乐生成系统,并且在 Artificial Analysis Music Arena Vocals 上拿到 1105 Elo —— 仅次于 Suno V5.5 和 Mureka,领先 Suno V5 与 MiniMax 模型。对于做 TTS / 音乐 / 多模态生成工程的人,这是一个可对照、可消融、可借鉴的架构样板。

1. 一句话结论

StepAudio 3 Music 把「先写 ABC 乐谱、再让 DiT 唱歌」变成一条显式 Chain-of-Thought,让长篇音乐生成从端到端黑箱转向「结构先验 + 声学重建」两阶段范式,并在 5 分 30 秒内的多任务生成(歌曲 / 器乐 / 干声伴奏 / 翻唱)上拿到目前公开榜单第二档的 Elo。

2. 它在解决什么真问题

长篇音乐生成有三个长期痛点:

  • 结构先验缺位:扩散或自回归直接吃波形,模型不知道「这里是主歌、那里是副歌」,于是经常出现节拍漂移、和声反复、调性崩塌。
  • 可控性差:用户给文本 prompt「给我一段 80 BPM 的 C 大调布鲁斯」,模型只能在采样空间里瞎撞;想做"主歌+副歌"的强结构,几乎要靠后处理拼接。
  • 任务多样性不足:同一个模型既要做歌曲又要做纯伴奏又要做翻唱,传统单任务训练成本爆炸。

StepAudio 3 Music 的解法是把乐谱(ABC notation)作为可解释的中间表征:先用 MoE 自回归生成一份「排版计划」(harmony / rhythm / melody 三维),再让 DiT 据此渲染音频。乐谱不是装饰,而是 generation context 的一部分。

3. 核心方法:四件套拼起来

3.1 StepAudio Music Tokenizer:单 codebook 50 Hz 流

  • 把音频压成一个 50 Hz、65,536 条目单 codebook 的离散 token 流。
  • 训练走「semantically informed 自监督 + 多任务」两条腿:一方面让 tokenizer 学到结构信息(节拍、调性、和声),另一方面保留声学重建所需的细节。
  • 为什么是单 codebook 而不是 Semantic/Acoustic RVQ:作者做了对比消融 —— Semantic+Acoustic RVQ 在重建质量上有优势,但 DiT 预测难度更高、单 codebook 让 DiT 可以无脑跑 flow-matching。离散-连续设计的关键是 tokenizer 别给 DiT 添堵

3.2 Flow-matching DiT:预测连续 VAE latent

  • DiT 不是预测离散 token,而是预测连续的 StepAudio VAE latent,再由 VAE 解码器还原成 48 kHz 波形。
  • 这是「离散 token 负责结构,连续 latent 负责音色」的双轨:tokenizer 输出离散流,是为了让 planning 部分(ABC-CoT)可以离散自回归;DiT 输出连续 latent,是为了让声学重建保真度不要被量化噪声拉低。

伪代码示意(节选):

# 阶段 1: tokenizer 把 48 kHz 音频编码为 50 Hz 离散 token 流
audio_tokens = MusicTokenizer.encode(wav)  # shape [T, 1], 65,536-entry codebook

# 阶段 2: MoE 自回归模型先写 ABC 乐谱(planning)
abc_plan = MoE_ARR.autoregressive(text_prompt)        # ABC notation string
music_tokens = MoE_ARR.autoregressive(abc_plan, text_prompt)  # 50 Hz discrete

# 阶段 3: DiT 预测连续 VAE latent
latents = FlowMatching_DiT(music_tokens, abc_plan, text_prompt)

# 阶段 4: VAE 解码
wav_out = StepAudio_VAE.decode(latents)  # 48 kHz stereo

3.3 ABC-CoT:显式音乐规划

  • 一个 Mixture-of-Experts 自回归模型,先以 ABC 乐谱形式写出"排版计划",再去预测音乐 token。
  • ABC notation(文本化的简谱体系)天然擅长编码 harmony、rhythm、melodic structure,因此可以成为「可读、可编辑、可约束」的中间表征。
  • Chain-of-Thought 的精髓是:让模型把"和声、节奏、旋律走向"先讲一遍,再去渲染细节。这一招借自文本 LLM 的 CoT,但在音乐领域落地需要乐谱这种领域语言。

3.4 训练 pipeline:progressive curriculum + SFT + DPO

  • 训练分三阶段:progressive 课程学习 → 监督微调(SFT) → DPO 偏好对齐。
  • SFT 阶段覆盖四个任务:歌曲生成、纯器乐生成、干声→伴奏生成、cover-song 翻唱。
  • DPO 用偏好信号优化 AudioBox 的 Content Enjoyment / Content Usefulness / Production Quality 三项。
  • 最长支持 5 分 30 秒,这比多数 TTS 系统能撑的 30 秒~2 分钟长一个量级。

4. 关键实验与数据

任务 / 基准 StepAudio 3 Music 对照
AudioBox Content Enjoyment 最高(榜首) 多个 SOTA 系统
AudioBox Content Usefulness 最高(榜首) 同上
AudioBox Production Quality 最高(榜首) 同上
MuQ-MuLan 相似度 最高 多个系统
SongBench 具竞争力 多个系统
Artificial Analysis Music Arena Vocals Elo 1105 仅次于 Suno V5.5 和 Mureka,领先 Suno V5、MiniMax 模型等

⚠️ 注意:上述"最高"均来自论文自述口径,对比系统的具体名单和置信区间在 abstract 中未明列,需查 PDF Tables 才能完整核验。Elo 数字 1105 是公开榜单的硬数字,可信。

5. 亮点与局限

5.1 亮点

  • 架构创新扎实:单 codebook tokenizer + flow-matching DiT 的组合,是把"扩散 + 离散规划"两套范式缝合的清晰范本,消融结论(单 codebook vs Semantic/Acoustic RVQ)写得明确。
  • 规划可解释:ABC-CoT 让生成结果第一次有了"可读、可编辑的中间计划",对内容审核、人机协作、版权追溯都友好。
  • 任务覆盖广:歌曲、器乐、干声伴奏、cover-song 一模型搞定,5 分 30 秒长度,落地场景覆盖明显宽于单任务模型。
  • 公开榜单有真东西:Artificial Analysis Music Arena Vocals Elo 1105,位列第二档(仅次于 Suno V5.5 和 Mureka),不是只在自己 benchmark 上自嗨。

5.2 局限

  • 算力门槛高:196B MoE(11B active)的语言 backbone 是 Step 3.7 Flash,训练 1.2T tokens —— 小团队复现基本不现实。
  • 风格偏向局限:Elo 1105 是 Vocals 榜单的子项,整体音乐风格覆盖、人声多样性是否优于 Suno/Mureka 未充分披露。
  • 可控 prompt 与 ABC 编辑:论文提及「ABC-CoT 让 harmony/rhythm/melody 成为 generation context」,但用户能否实时编辑 ABC 来"中途改调"未在 abstract 中明说,需查正文交互式 demo 的描述。
  • DPO 偏好来源:DPO 用的是 AudioBox 指标,但 AudioBox 本身的偏差、训练数据来源、对长篇结构的判断力未在 abstract 中披露。

6. 对工程落地的启发

  1. Tokenizer 别给下游添堵:做多模态生成的人最容易踩的坑是 tokenizer 精度太高 / 码本太大,下游 DiT 训练不动。StepAudio 3 Music 单 codebook 65,536 的选择是一个"为下游着想"的范本。
  2. 离散规划 + 连续渲染是普适范式:文本领域 CoT 用自然语言、代码领域 CoT 用伪代码、音乐领域用 ABC notation —— 关键是为下游选一个"领域可读、长度可控、损失低"的中间表征。
  3. DPO 之前先 SFT:作者走的是 progressive curriculum → SFT → DPO 三段式,跳过 SFT 直接 DPO 在长篇生成上普遍崩。
  4. 榜单选真公开的:Artificial Analysis Music Arena 是公开榜,能拿来横向对比;自己搭 benchmark 的口径容易自欺。

7. 与同方向工作的关系

  • Suno V5 / V5.5、Mureka 同台对标:在 Artificial Analysis Music Arena Vocals 上拿到 Elo 1105,仅落后两家头部产品。
  • MiniMax Music / 字节豆包音乐 / 网易天音:Elo 数字位列 MiniMax 模型之前(原文表述"ahead of Suno V5, MiniMax models, and other systems")。
  • MusicGen(Meta)、AudioLDM 系列、Riffusion 等扩散音乐模型相比,StepAudio 3 Music 的差异化在于「显式 ABC 规划」与「单 codebook + DiT 离散-连续混合」两条线。
  • 与同公司 StepAudio 3 Realtime(2609.14005)的区别:Music 走长篇音乐生成、Realtime 走实时语音对话;两者共享 audio-language foundation 但目标场景不同。

8. 适合谁读

  • 音频 / 多模态生成工程师:看 tokenizer + DiT 架构选型、ABC-CoT 工程实现细节。
  • AIGC 产品经理:看 Artificial Analysis Music Arena 上 Elo 1105 的落地价值与"距离 Suno/Mureka 还有多大差距"。
  • 音乐信息检索(MIR)研究者:看 ABC notation 作为 generation context 的实验设计,是否可以借鉴到结构化乐谱分析任务。
  • 对齐 / RLHF 团队:看 DPO 在长篇生成任务上的应用范本(AudioBox 三项偏好指标 + SFT 前置)。

9. 不确定处(诚实声明)

  • "AudioBox Content Enjoyment / Content Usefulness / Production Quality 三项最高"的具体对比系统名单与置信区间未在 abstract 中给出,⚠️ 需查 PDF Tables
  • "Ahead of Suno V5, MiniMax models, and other systems" 中 MiniMax 模型具体指哪些系统未点名,⚠️ 需查正文
  • 5 分 30 秒的最长生成时间是否包含 ABC-CoT 推理时间、端到端 wall-clock latency 未在 abstract 中披露。
  • 用户能否交互式编辑 ABC 乐谱做"中途改调"未在 abstract 中明说,⚠️ 需查 demo 页或正文
  • 模型权重 / 推理代码是否开源未在 abstract 中给出(仅给了音频演示页),GitHub 仓库状态待核

来源:arXiv abstract / paper card 1393-2609-16034 / 演示页链接。 字数:约 2,800 字(中文计)。