MisoLabsAI/MisoTTS · 上手攻略
- 仓库:MisoLabsAI/MisoTTS
- 链接:https://github.com/MisoLabsAI/MisoTTS
- 分类:TTS · speech-synthesis
- 作者:Jay
- 更新:2026-08-07
这是什么
Miso TTS 是 Miso Labs 开发的一个80 亿参数高表现力文本转对话语音模型(8B parameters),灵感来源于 Sesame 的 CSM(Conversational Speech Model)架构。它使用 RVQ Transformer( Residual Vector Quantization Transformer)架构,结合 Llama 3.2 风格的大骨干网络和一个较小的自回归音频解码器,能生成极具情感表现力的对话式语音。模型权重托管在 Hugging Face(MisoLabs/MisoTTS),支持通过参考音频实现语音克隆(Voice Cloning)。
解决的问题: 提供一个开源的高表现力 TTS 模型,填补了开源社区在情感丰富、对话自然的中大规模 TTS 方面的空白,且支持语音克隆,无需商业 API 即可本地运行。
核心架构
输入:text + optional audio context
↓
骨干 Transformer(Llama 3.2 风格,~8B 参数)
↓ (生成 audio frame embeddings)
音频解码 Transformer(~300M 参数,自回归)
↓
Mimi 音频编码器(32 个 codebooks,VQ 词汇 2,051)
↓
输出:Mimi 音频码 → 解码为 WAV
- 骨干网络:类似 Llama 3.2 的 Transformer,消耗交错的文本和音频 token,能在生成时条件化于对话历史。
- 音频解码器:较小的自回归 Transformer,在每个帧内预测更高阶的音频码本。
- Mimi 音频 tokenizer:32 个 codebook,VQ 词汇 2,051,将音频离散化为 token 序列。
- 最大序列长度:2,048 tokens。
⚠️ 重要说明: 公开讨论中提到的 110ms 延迟是指 Miso Labs 官方托管 API 在 H100 GPU 上的 TTFB(Time To First Byte),而非本仓库未经优化的本地推理路径。本地运行的实际生成延迟会显著更高。
快速安装
环境准备(推荐 uv)
# 1. 安装 uv(如未安装)
curl -LsSf https://astral.sh/uv/install.sh | sh
# 2. 克隆仓库
git clone https://github.com/MisoLabsAI/MisoTTS.git
cd MisoTTS
# 3. 创建环境并激活
uv sync --python 3.10
source .venv/bin/activate
# 4. 运行示例(自动下载模型到 Hugging Face 缓存)
uv run python run_misotts.py
# 输出文件:repository root 下的 full_conversation.wav
备选:pip + venv
python3.10 -m venv .venv
source .venv/bin/activate
pip install -e .
python run_misotts.py
首次运行会下载约 30–40 GB 数据(模型 checkpoint + Mimi codec + SilentCipher 水印模型 + Llama 3.2 tokenizer),确保磁盘空间充足。后续运行复用缓存。
核心用法
基本生成(无参考音频)
import torch
import torchaudio
from generator import load_miso_8b
device = "cuda" if torch.cuda.is_available() else "cpu"
generator = load_miso_8b(
device=device,
model_path_or_repo_id="MisoLabs/MisoTTS",
)
audio = generator.generate(
text="Hello from Miso.",
speaker=0,
context=[], # 无参考音频时为空列表
max_audio_length_ms=10_000,
)
torchaudio.save("miso.wav", audio.unsqueeze(0).cpu(), generator.sample_rate)
speaker=0 是说话人 ID(用于多说话人模型的风格控制);max_audio_length_ms 控制最大生成长度。
语音克隆(参考音频)
import torchaudio
from generator import Segment, load_miso_8b
generator = load_miso_8b(device="cuda")
# 加载参考音频
prompt_audio, sample_rate = torchaudio.load("prompt.wav")
prompt_audio = torchaudio.functional.resample(
prompt_audio.squeeze(0),
orig_freq=sample_rate,
new_freq=generator.sample_rate,
)
# 构建上下文(必须附上对应的文字 transcript)
context = [
Segment(
speaker=0,
text="This is the transcript for the prompt audio.",
audio=prompt_audio,
)
]
# 生成新语音
audio = generator.generate(
text="This is the next sentence to synthesize.",
speaker=0,
context=context,
max_audio_length_ms=10_000,
)
torchaudio.save("cloned.wav", audio.unsqueeze(0).cpu(), generator.sample_rate)
注意: context 中的 text 字段必须填写参考音频对应的文字 transcript,模型据此理解参考音频的内容。
硬件需求
| 精度 | 权重大小(约) | 推荐显存 | 示例 GPU |
|---|---|---|---|
| bfloat16 / fp16 | ~16 GB | 24 GB | RTX 3090 / 4090, A5000, L4 (24 GB) |
| float32 | ~33 GB | 40 GB+ | A100 40 GB, A6000 48 GB, H100 |
消费级 GPU 不足以运行完整模型:4–16 GB 的小显存卡不够。CPU 推理可以运行但非常慢(至少准备 ~20 GB RAM for bfloat16 / ~40 GB for float32)。
本地推理默认使用 torch.bfloat16,24 GB 显存卡可以容纳 bf16 权重加上 KV cache 和激活值的开销。
坑与注意
- 不是轻量级模型:~8.2B 参数(骨干 + 音频解码器 + embeddings + heads),需要认真对待硬件需求,不要期望在笔记本上流畅运行。
- 110ms 延迟是托管 API 的数字:本地推理延迟远高于此,不要被公开宣传误导。
- 首次下载量大:30–40 GB,包含多个大型模型文件。国内网络下载 Hugging Face 模型可能较慢,建议配置镜像(如 hf-mirror.com)。
- SilentCipher 水印下载超时:首次运行如果 SilentCipher 模型下载超时,直接重跑命令,Hugging Face 缓存会从已完成的文件继续。
- 仅支持英语:官方明确说明 Miso TTS 8B 当前仅支持英语,不支持中文等多语言。
- 不要用于冒充他人:仓库明确禁止使用此模型进行语音冒充、欺诈或生成有害内容。
- 水印机制:默认对生成的音频加水印。如部署到其他应用,应使用自己的私密水印密钥并妥善保管。
与同类对比
| 模型 | 参数量 | 架构 | 克隆支持 | 开源 | 备注 |
|---|---|---|---|---|---|
| Miso TTS 8B | 8B | RVQ Transformer + Llama backbone | ✅ | ✅ | 高表现力对话 TTS,适合情感丰富场景 |
| Sesame CSM | 1B (?) | Conformer-based | ✅ | ❌ | 商业模型,Miso 的主要参考架构 |
| Tortoise-TTS | ~2B | Autoregressive + diffusion | ✅ | ✅ | 开源老将,音质好但慢 |
| Bark (Suno) | ~0.4B | GPT-style | ✅ (via prompt) | ✅ | 轻量,但自然度逊于 8B 级别模型 |
| Parler-TTS | ~0.7B | Decoder-only | ✅ | ✅ | 轻量,适合快速实验 |
Miso TTS 8B 的定位:在开源高表现力 TTS 中属于最大规模之一,相比轻量级开源模型(Bark、 Parler-TTS)有明显规模优势;相比 Sesame CSM 等商业模型则完全开源可本地部署。
一句话推荐
如果你需要一个高表现力、支持语音克隆、可完全本地运行的开源 TTS 模型,且有 24 GB 以上显存的 GPU,Miso TTS 8B 是目前开源社区中规模最大、表现力最强的选择之一;只需接受它"不是轻量玩具"的硬件门槛和仅支持英语的限制。
原始仓库:https://github.com/MisoLabsAI/MisoTTS · Hugging Face:https://huggingface.co/MisoLabs/MisoTTS · 本攻略基于 2026-08-07 公开版本撰写,未 clone 或运行代码。硬件/延迟数据来自仓库 README 标注,具体数值可能因环境而异。