Yuan-ManX/ai-audio-datasets · 上手攻略
- 仓库:Yuan-ManX/ai-audio-datasets
- 链接:https://github.com/Yuan-ManX/ai-audio-datasets
- 分类:academic-writing
- 作者:Jay
- 更新:2026-08-23
这是什么
AI Audio Datasets(AI-ADS)是一个持续更新的开源知识库,汇集了语音(Speech)、音乐(Music)和音效(Sound Effect)三大类高质量音频数据集,旨在为生成式 AI、AIGC、模型训练、智能音频工具开发和音频应用提供训练数据资源。仓库本身是一个精心分类的导航索引,每个数据集条目都附带了官方来源链接、数据规模说明和适用任务标注。
适用人群:TTS/VC 模型训练研究者、语音识别(ASR)工程师、音频多模态模型开发者、AI 音频数据集收藏者。
解决什么问题
找音频训练数据时,研究者往往需要奔波于 OpenSLR、HuggingFace、Zenodo、GitHub 等十余个平台,还要自己判断数据规模、质量和许可协议。AI-ADS 将这些信息聚合到一个仓库里,按语音/音乐/音效分类组织,每个数据集都附带关键元数据(小时数、语言、采样率、许可证、下载地址),节省了初期调研的巨量时间。
⚠️ 注意:这是一个索引/导航仓库,仓库本身不托管数据文件,所有数据需从各数据集原始来源下载。
快速了解:精选数据集一览
语音类(Speech)
| 数据集 | 规模 | 语言 | 用途 |
|---|---|---|---|
| LibriSpeech | ~1000 小时 | 英语 | ASR 训练/评测基准 |
| AISHELL-1 | 150 小时 | 普通话 | 中文 ASR |
| AISHELL-3 | 85 小时,218 说话人 | 普通话 | 多说话人 TTS |
| Common Voice | 9283 小时(录制)/ 7335 小时(验证) | 60 种语言 | 多语言 ASR |
| GigaSpeech | 10000 小时(标注)/ 40000 小时(半监督) | 英语 | 大规模 ASR |
| LibriTTS | 585 小时 | 英语 | TTS 研究 |
| LibriTTS-R | 585 小时(降噪恢复版) | 英语 | 高质量 TTS |
| LJ Speech | ~24 小时 | 英语 | 单说话人 TTS 入门 |
| ESD (Emotional Speech Database) | 29 小时,10 英+10 中说话人 | 英/中 | 情感语音转换 |
| CoVoST 2 | 2880 小时 | 21 种语言→英语 | 语音翻译(ST) |
| MuST-C | 8 个语言方向 | 英→德/西/法等 | 语音翻译 |
| Emilia | 101000+ 小时 | 英/中/德/法/日/韩 | 多语言大规模 TTS |
| Audio-FLAN | 1 亿+ 实例,80 任务 | 多语言 | 音频指令微调 |
音乐类(Music)
(仓库中持续收录,涵盖 MusicCaps、MusicLM 相关数据集、FMA、MAESTRO 等)
音效类(Sound Effect)
(收录 AudioCaps、Clotho 等音频描述数据集,适用于音频生成和音频字幕任务)
核心用法
作为数据集调研工具
直接在该仓库的 README 中按分类浏览,找到合适的数据集后通过原始链接访问下载。
典型工作流示例
# 1. 确定任务:中文多说话人 TTS
# → 参考 AISHELL-3
# 2. 确定任务:英文大规模 ASR 预训练
# → 参考 GigaSpeech + LibriSpeech 组合
# 3. 确定任务:情感语音转换
# → 参考 ESD(5 情绪类别,10 英+10 中说话人)
# 4. 确定任务:语音翻译
# → 参考 CoVoST 2(21 种语言)或 MuST-C(8 个语言方向)
数据集选择决策树
音频任务类型
├── ASR(自动语音识别)
│ ├── 英语 → LibriSpeech(干净)/ GigaSpeech(大规模)
│ ├── 普通话 → AISHELL-1
│ └── 多语言 → Common Voice
├── TTS(文本到语音)
│ ├── 单说话人 → LJ Speech / LibriTTS
│ ├── 多说话人 → LibriTTS / AISHELL-3
│ └── 大规模多语言 → Emilia(101K 小时,6 种语言)
├── 语音转换(VC)
│ └── ESD(情感语音数据库)
├── 语音翻译(ST)
│ ├── 英→X → MuST-C
│ └── 多语言 → CoVoST 2
└── 音频生成/字幕
└── Clotho / AudioCaps(音效)
典型适用场景
- TTS 模型训练:从 LJ Speech(入门)→ LibriTTS(多说话人)→ Emilia(超大规模)都有覆盖,按需选择。
- ASR 模型预训练:GigaSpeech 40K 小时半监督语料是目前最具规模的英文 ASR 资源。
- 语音翻译研究:CoVoST 2 覆盖 21 种语言到英语的翻译,是语音翻译ST 任务的重要基准。
- 多模态音频-语言模型:Audio-FLAN 的 1 亿+ 实例覆盖 80 种任务,是音频指令微调的首选数据集。
- 语音情感研究:ESD 提供 5 类情绪的平行数据,适合情感 VC 和情感 TTS。
坑与注意
⚠️ 数据许可差异大:各数据集许可证各不相同(Common Voice CC0 / LibriSpeech PD / ESD 需申请),使用前务必仔细阅读原始页面许可条款,禁止直接假设为商业可用。
⚠️ 数据下载方式不一:部分数据集托管在 OpenSLR(直接下载)、Zenodo(需注册)、HuggingFace(需 login)、GitHub(可能因网络问题 clone 失败),建议准备多个下载途径。
⚠️ 规模标注可能有出入:README 中的小时数基于原始数据集发布时统计,实际可用数据可能因过滤、去重而略少。
⚠️ 中文数据集相对少:仓库中英文数据集最全,中文语音数据集主要有 AISHELL 系列,粤语、方言覆盖有限。
⚠️ 仓库不托管数据:数据都在各自原始来源,仓库只是索引——无法"clone 即得数据",需要额外下载步骤。
与同类对比
| 资源 | 类型 | 规模 | 特色 |
|---|---|---|---|
| AI-ADS(本仓库) | 导航索引 | 数百数据集 | 语音+音乐+音效全覆盖,持续更新 |
| HuggingFace Datasets | 平台索引 | 数十万 | 覆盖面最广,但无任务导向分类 |
| OpenSLR | 数据托管 | ~30 个语音集 | 专注语音,直接下载,中文资源友好 |
| Google Datasets Search | 搜索引擎 | 全网 | 通用搜索,音频专项不够聚焦 |
AI-ADS 的优势在于任务导向的分类组织和中文维护者视角(AISHELL 系列、 GenshinVoice 等中文相关内容天然占比较高),适合快速筛选而非漫无目的搜索。
一句话推荐结论
做音频 AI 研究,AI-ADS 是目前 GitHub 上最省时的数据集导航起点——无论是找 TTS 训练语料还是 ASR 评测基准,先来这里看一眼再动身,总能少走弯路。
数据来源:GitHub README 数据集列表;各数据集规模、语言、许可证信息以原始发布页面为准。