Yuan-ManX/ai-audio-datasets · 上手攻略

  • 仓库:Yuan-ManX/ai-audio-datasets
  • 链接:https://github.com/Yuan-ManX/ai-audio-datasets
  • 分类:academic-writing
  • 作者:Jay
  • 更新:2026-08-23

这是什么

AI Audio Datasets(AI-ADS)是一个持续更新的开源知识库,汇集了语音(Speech)、音乐(Music)和音效(Sound Effect)三大类高质量音频数据集,旨在为生成式 AI、AIGC、模型训练、智能音频工具开发和音频应用提供训练数据资源。仓库本身是一个精心分类的导航索引,每个数据集条目都附带了官方来源链接、数据规模说明和适用任务标注。

适用人群:TTS/VC 模型训练研究者、语音识别(ASR)工程师、音频多模态模型开发者、AI 音频数据集收藏者。

解决什么问题

找音频训练数据时,研究者往往需要奔波于 OpenSLR、HuggingFace、Zenodo、GitHub 等十余个平台,还要自己判断数据规模、质量和许可协议。AI-ADS 将这些信息聚合到一个仓库里,按语音/音乐/音效分类组织,每个数据集都附带关键元数据(小时数、语言、采样率、许可证、下载地址),节省了初期调研的巨量时间。

⚠️ 注意:这是一个索引/导航仓库,仓库本身不托管数据文件,所有数据需从各数据集原始来源下载。

快速了解:精选数据集一览

语音类(Speech)

数据集 规模 语言 用途
LibriSpeech ~1000 小时 英语 ASR 训练/评测基准
AISHELL-1 150 小时 普通话 中文 ASR
AISHELL-3 85 小时,218 说话人 普通话 多说话人 TTS
Common Voice 9283 小时(录制)/ 7335 小时(验证) 60 种语言 多语言 ASR
GigaSpeech 10000 小时(标注)/ 40000 小时(半监督) 英语 大规模 ASR
LibriTTS 585 小时 英语 TTS 研究
LibriTTS-R 585 小时(降噪恢复版) 英语 高质量 TTS
LJ Speech ~24 小时 英语 单说话人 TTS 入门
ESD (Emotional Speech Database) 29 小时,10 英+10 中说话人 英/中 情感语音转换
CoVoST 2 2880 小时 21 种语言→英语 语音翻译(ST)
MuST-C 8 个语言方向 英→德/西/法等 语音翻译
Emilia 101000+ 小时 英/中/德/法/日/韩 多语言大规模 TTS
Audio-FLAN 1 亿+ 实例,80 任务 多语言 音频指令微调

音乐类(Music)

(仓库中持续收录,涵盖 MusicCaps、MusicLM 相关数据集、FMA、MAESTRO 等)

音效类(Sound Effect)

(收录 AudioCaps、Clotho 等音频描述数据集,适用于音频生成和音频字幕任务)

核心用法

作为数据集调研工具

直接在该仓库的 README 中按分类浏览,找到合适的数据集后通过原始链接访问下载。

典型工作流示例

# 1. 确定任务:中文多说话人 TTS
# → 参考 AISHELL-3

# 2. 确定任务:英文大规模 ASR 预训练
# → 参考 GigaSpeech + LibriSpeech 组合

# 3. 确定任务:情感语音转换
# → 参考 ESD(5 情绪类别,10 英+10 中说话人)

# 4. 确定任务:语音翻译
# → 参考 CoVoST 2(21 种语言)或 MuST-C(8 个语言方向)

数据集选择决策树

音频任务类型
├── ASR(自动语音识别)
│   ├── 英语 → LibriSpeech(干净)/ GigaSpeech(大规模)
│   ├── 普通话 → AISHELL-1
│   └── 多语言 → Common Voice
├── TTS(文本到语音)
│   ├── 单说话人 → LJ Speech / LibriTTS
│   ├── 多说话人 → LibriTTS / AISHELL-3
│   └── 大规模多语言 → Emilia(101K 小时,6 种语言)
├── 语音转换(VC)
│   └── ESD(情感语音数据库)
├── 语音翻译(ST)
│   ├── 英→X → MuST-C
│   └── 多语言 → CoVoST 2
└── 音频生成/字幕
    └── Clotho / AudioCaps(音效)

典型适用场景

  1. TTS 模型训练:从 LJ Speech(入门)→ LibriTTS(多说话人)→ Emilia(超大规模)都有覆盖,按需选择。
  2. ASR 模型预训练:GigaSpeech 40K 小时半监督语料是目前最具规模的英文 ASR 资源。
  3. 语音翻译研究:CoVoST 2 覆盖 21 种语言到英语的翻译,是语音翻译ST 任务的重要基准。
  4. 多模态音频-语言模型:Audio-FLAN 的 1 亿+ 实例覆盖 80 种任务,是音频指令微调的首选数据集。
  5. 语音情感研究:ESD 提供 5 类情绪的平行数据,适合情感 VC 和情感 TTS。

坑与注意

⚠️ 数据许可差异大:各数据集许可证各不相同(Common Voice CC0 / LibriSpeech PD / ESD 需申请),使用前务必仔细阅读原始页面许可条款,禁止直接假设为商业可用。

⚠️ 数据下载方式不一:部分数据集托管在 OpenSLR(直接下载)、Zenodo(需注册)、HuggingFace(需 login)、GitHub(可能因网络问题 clone 失败),建议准备多个下载途径。

⚠️ 规模标注可能有出入:README 中的小时数基于原始数据集发布时统计,实际可用数据可能因过滤、去重而略少。

⚠️ 中文数据集相对少:仓库中英文数据集最全,中文语音数据集主要有 AISHELL 系列,粤语、方言覆盖有限。

⚠️ 仓库不托管数据:数据都在各自原始来源,仓库只是索引——无法"clone 即得数据",需要额外下载步骤。

与同类对比

资源 类型 规模 特色
AI-ADS(本仓库) 导航索引 数百数据集 语音+音乐+音效全覆盖,持续更新
HuggingFace Datasets 平台索引 数十万 覆盖面最广,但无任务导向分类
OpenSLR 数据托管 ~30 个语音集 专注语音,直接下载,中文资源友好
Google Datasets Search 搜索引擎 全网 通用搜索,音频专项不够聚焦

AI-ADS 的优势在于任务导向的分类组织中文维护者视角(AISHELL 系列、 GenshinVoice 等中文相关内容天然占比较高),适合快速筛选而非漫无目的搜索。

一句话推荐结论

做音频 AI 研究,AI-ADS 是目前 GitHub 上最省时的数据集导航起点——无论是找 TTS 训练语料还是 ASR 评测基准,先来这里看一眼再动身,总能少走弯路。


数据来源:GitHub README 数据集列表;各数据集规模、语言、许可证信息以原始发布页面为准。