MisoLabsAI/MisoTTS · 上手攻略

  • 仓库:MisoLabsAI/MisoTTS
  • 链接:https://github.com/MisoLabsAI/MisoTTS
  • 分类:TTS · speech-synthesis
  • 作者:Jay
  • 更新:2026-08-07

这是什么

Miso TTS 是 Miso Labs 开发的一个80 亿参数高表现力文本转对话语音模型(8B parameters),灵感来源于 Sesame 的 CSM(Conversational Speech Model)架构。它使用 RVQ Transformer( Residual Vector Quantization Transformer)架构,结合 Llama 3.2 风格的大骨干网络和一个较小的自回归音频解码器,能生成极具情感表现力的对话式语音。模型权重托管在 Hugging Face(MisoLabs/MisoTTS),支持通过参考音频实现语音克隆(Voice Cloning)。

解决的问题: 提供一个开源的高表现力 TTS 模型,填补了开源社区在情感丰富、对话自然的中大规模 TTS 方面的空白,且支持语音克隆,无需商业 API 即可本地运行。

核心架构

输入:text + optional audio context
  ↓
骨干 Transformer(Llama 3.2 风格,~8B 参数)
  ↓ (生成 audio frame embeddings)
音频解码 Transformer(~300M 参数,自回归)
  ↓
Mimi 音频编码器(32 个 codebooks,VQ 词汇 2,051)
  ↓
输出:Mimi 音频码 → 解码为 WAV
  • 骨干网络:类似 Llama 3.2 的 Transformer,消耗交错的文本和音频 token,能在生成时条件化于对话历史。
  • 音频解码器:较小的自回归 Transformer,在每个帧内预测更高阶的音频码本。
  • Mimi 音频 tokenizer:32 个 codebook,VQ 词汇 2,051,将音频离散化为 token 序列。
  • 最大序列长度:2,048 tokens。

⚠️ 重要说明: 公开讨论中提到的 110ms 延迟是指 Miso Labs 官方托管 API 在 H100 GPU 上的 TTFB(Time To First Byte),而非本仓库未经优化的本地推理路径。本地运行的实际生成延迟会显著更高。

快速安装

环境准备(推荐 uv)

# 1. 安装 uv(如未安装)
curl -LsSf https://astral.sh/uv/install.sh | sh

# 2. 克隆仓库
git clone https://github.com/MisoLabsAI/MisoTTS.git
cd MisoTTS

# 3. 创建环境并激活
uv sync --python 3.10
source .venv/bin/activate

# 4. 运行示例(自动下载模型到 Hugging Face 缓存)
uv run python run_misotts.py
# 输出文件:repository root 下的 full_conversation.wav

备选:pip + venv

python3.10 -m venv .venv
source .venv/bin/activate
pip install -e .
python run_misotts.py

首次运行会下载约 30–40 GB 数据(模型 checkpoint + Mimi codec + SilentCipher 水印模型 + Llama 3.2 tokenizer),确保磁盘空间充足。后续运行复用缓存。

核心用法

基本生成(无参考音频)

import torch
import torchaudio

from generator import load_miso_8b

device = "cuda" if torch.cuda.is_available() else "cpu"

generator = load_miso_8b(
    device=device,
    model_path_or_repo_id="MisoLabs/MisoTTS",
)

audio = generator.generate(
    text="Hello from Miso.",
    speaker=0,
    context=[],          # 无参考音频时为空列表
    max_audio_length_ms=10_000,
)

torchaudio.save("miso.wav", audio.unsqueeze(0).cpu(), generator.sample_rate)

speaker=0 是说话人 ID(用于多说话人模型的风格控制);max_audio_length_ms 控制最大生成长度。

语音克隆(参考音频)

import torchaudio
from generator import Segment, load_miso_8b

generator = load_miso_8b(device="cuda")

# 加载参考音频
prompt_audio, sample_rate = torchaudio.load("prompt.wav")
prompt_audio = torchaudio.functional.resample(
    prompt_audio.squeeze(0),
    orig_freq=sample_rate,
    new_freq=generator.sample_rate,
)

# 构建上下文(必须附上对应的文字 transcript)
context = [
    Segment(
        speaker=0,
        text="This is the transcript for the prompt audio.",
        audio=prompt_audio,
    )
]

# 生成新语音
audio = generator.generate(
    text="This is the next sentence to synthesize.",
    speaker=0,
    context=context,
    max_audio_length_ms=10_000,
)

torchaudio.save("cloned.wav", audio.unsqueeze(0).cpu(), generator.sample_rate)

注意: context 中的 text 字段必须填写参考音频对应的文字 transcript,模型据此理解参考音频的内容。

硬件需求

精度 权重大小(约) 推荐显存 示例 GPU
bfloat16 / fp16 ~16 GB 24 GB RTX 3090 / 4090, A5000, L4 (24 GB)
float32 ~33 GB 40 GB+ A100 40 GB, A6000 48 GB, H100

消费级 GPU 不足以运行完整模型:4–16 GB 的小显存卡不够。CPU 推理可以运行但非常慢(至少准备 ~20 GB RAM for bfloat16 / ~40 GB for float32)。

本地推理默认使用 torch.bfloat16,24 GB 显存卡可以容纳 bf16 权重加上 KV cache 和激活值的开销。

坑与注意

  1. 不是轻量级模型:~8.2B 参数(骨干 + 音频解码器 + embeddings + heads),需要认真对待硬件需求,不要期望在笔记本上流畅运行。
  2. 110ms 延迟是托管 API 的数字:本地推理延迟远高于此,不要被公开宣传误导。
  3. 首次下载量大:30–40 GB,包含多个大型模型文件。国内网络下载 Hugging Face 模型可能较慢,建议配置镜像(如 hf-mirror.com)。
  4. SilentCipher 水印下载超时:首次运行如果 SilentCipher 模型下载超时,直接重跑命令,Hugging Face 缓存会从已完成的文件继续。
  5. 仅支持英语:官方明确说明 Miso TTS 8B 当前仅支持英语,不支持中文等多语言。
  6. 不要用于冒充他人:仓库明确禁止使用此模型进行语音冒充、欺诈或生成有害内容。
  7. 水印机制:默认对生成的音频加水印。如部署到其他应用,应使用自己的私密水印密钥并妥善保管。

与同类对比

模型 参数量 架构 克隆支持 开源 备注
Miso TTS 8B 8B RVQ Transformer + Llama backbone 高表现力对话 TTS,适合情感丰富场景
Sesame CSM 1B (?) Conformer-based 商业模型,Miso 的主要参考架构
Tortoise-TTS ~2B Autoregressive + diffusion 开源老将,音质好但慢
Bark (Suno) ~0.4B GPT-style ✅ (via prompt) 轻量,但自然度逊于 8B 级别模型
Parler-TTS ~0.7B Decoder-only 轻量,适合快速实验

Miso TTS 8B 的定位:在开源高表现力 TTS 中属于最大规模之一,相比轻量级开源模型(Bark、 Parler-TTS)有明显规模优势;相比 Sesame CSM 等商业模型则完全开源可本地部署。

一句话推荐

如果你需要一个高表现力、支持语音克隆、可完全本地运行的开源 TTS 模型,且有 24 GB 以上显存的 GPU,Miso TTS 8B 是目前开源社区中规模最大、表现力最强的选择之一;只需接受它"不是轻量玩具"的硬件门槛和仅支持英语的限制。


原始仓库:https://github.com/MisoLabsAI/MisoTTS · Hugging Face:https://huggingface.co/MisoLabs/MisoTTS · 本攻略基于 2026-08-07 公开版本撰写,未 clone 或运行代码。硬件/延迟数据来自仓库 README 标注,具体数值可能因环境而异。