AIGC-Audio/AudioGPT · 上手攻略
- 仓库:AIGC-Audio/AudioGPT
- 链接:https://github.com/AIGC-Audio/AudioGPT
- 分类:AI 音频 · 多模态生成
- 作者:Tom
- 更新:2026-08-18
这是什么
AudioGPT是由 AIGC-Audio 团队开源的多模态音频理解和生成框架,发布于 2023 年 4 月(arXiv:2304.12995)。其核心设计思路是:将 LLM(大语言模型)作为音频任务的统一调度层,底层对接各类音频/语音专有的预训练基础模型(Foundation Models),用户通过自然语言 Prompt 控制音频生成与理解任务。
GitHub 现状(2026-08-18):Stars 10.2k / Forks 850,代码主语言 Python,2024 年 7 月仍有 commit 更新(距今约 2 年无大版本更新)。
解决什么问题
传统音频模型通常只能做单一任务(TTS、ASR、歌声合成各自独立),AudioGPT 的设计目标是通过 LLM 的指令理解能力,将这些专有模型统一调度,用户说一句话就能触发多个音频任务。例如:
- "请把这段中文语音转换成英文语音" → TTS + 语音翻译
- "为这张图片生成配套的背景音乐" → Image Captioning + Text-to-Audio
- "生成一段演讲视频(Talking Head)" → TTS + GeneFace
本质上,它解决的是多模态音频任务编排的问题,而不是做底层模型。
支持的任务类型
语音类(Speech)
| 任务 | 支持的 Foundation Models | 状态 |
|---|---|---|
| 文本转语音(TTS) | FastSpeech2、SyntaSpeech、VITS | Yes (WIP) |
| 风格迁移 | GenerSpeech | Yes |
| 语音识别(ASR) | Whisper、Conformer | Yes |
| 语音增强 | ConvTasNet | Yes (WIP) |
| 语音分离 | TF-GridNet | Yes (WIP) |
| 语音翻译 | Multi-decoder | WIP |
| 单声道转双耳 | NeuralWarp | Yes |
歌唱类(Sing)
| 任务 | 支持的 Foundation Models | 状态 |
|---|---|---|
| 文本转歌声 | DiffSinger、VISinger | Yes (WIP) |
音频类(Audio)
| 任务 | 支持的 Foundation Models | 状态 |
|---|---|---|
| 文本转音频 | Make-An-Audio | Yes |
| 音频修补 | Make-An-Audio | Yes |
| 图像转音频 | Make-An-Audio | Yes |
| 声音检测 | Audio-transformer(HTS-Audio-Transformer) | Yes |
| 目标声音检测 | TSDNet | Yes |
| 声音提取 | LASSNet | Yes |
虚拟人合成(Talking Head)
| 任务 | 支持的 Foundation Models | 状态 |
|---|---|---|
| 说话人脸合成 | GeneFace | Yes (WIP) |
快速安装
环境准备
# 创建 conda 环境(Python 3.8)
conda create -n audiogpt python=3.8
conda activate audiogpt
# 安装基础依赖
pip install -r requirements.txt
下载基础模型
# 下载所需的基础模型(按需下载,不是所有模型都需要)
bash download.sh
配置 API Key 并启动
# 设置 OpenAI API Key(或兼容的 API)
export OPENAI_API_KEY={Your_Private_OpenAI_Key}
# 启动 AudioGPT
python audio-chatgpt.py
⚠️ download.sh 涉及的模型下载需网络通畅;部分基础模型(如 VITS、Whisper)来自第三方仓库,若下载脚本失效需手动从各模型官方仓库获取权重。
核心用法
基础调用流程
# audio-chatgpt.py 核心逻辑示意
import os
from audio_chatgpt import AudioGPT
# 初始化,设置 OpenAI API Key
os.environ["OPENAI_API_KEY"] = "your-key-here"
agent = AudioGPT()
# 自然语言请求音频任务
response = agent.chat("请将以下文本转为语音:今天天气真好")
print(response)
依赖的底层模型(部分)
AudioGPT 本身不训练底座模型,依赖这些开源模型(需自行下载权重):
# TTS 模型(VITS 示例)
git clone https://github.com/jaywalnut310/vits.git
# Whisper 语音识别
# 来自 openai/whisper 官方
# Make-An-Audio(文本转音频)
# 来自 audio/AIGC-Audio/AudioGPT 仓库内嵌
Talking Head 生成
# GeneFace 说话人脸合成
# 依赖:音频 + 人脸图像 → 输出说话视频
git clone https://github.com/yerfor/GeneFace.git
典型适用场景
- 多模态 demo 快速搭建:想做语音+音频+虚拟人多模态 demo,用 AudioGPT 做调度层比自己接各个模型快
- 音频任务链编排:需要语音识别→翻译→TTS 的完整链条,自然语言描述即可触发
- 学术研究基线:arXiv 论文官方代码仓库,可复现论文结果
- 多模型对比:同一任务切换不同 Foundation Model 对比效果
坑与注意
| 坑 | 说明 |
|---|---|
| 主模型需额外下载 | download.sh 下载的模型权重经常因网络问题失败,部分模型需手动从 Google Drive/百度网盘获取 |
| WIP 状态多 | 多数任务标注 Yes (WIP),实际运行可能不稳定;TTS 和 Talking Head 均属 WIP |
| 2024 年后基本停更 | Stars 10.2k 主要是 2023 年爆款期的历史积累,2024 年中后 commit 稀少 |
| OpenAI API 强依赖 | 核心调度层是 LLM,必须有 OpenAI API Key(或兼容 API),离线场景不可用 |
| 没有 S2S(Speech-to-Speech) | Issue #100 反映此问题至今仍是 open 状态 |
| 下载脚本损坏 | Issue #104(Sep 2025)反映所有下载 bash 文件损坏/报错 |
与同类对比
| 方案 | Stars | 架构 | 特点 |
|---|---|---|---|
| AudioGPT | 10.2k | LLM 调度 + 专有模型 | 自然语言控制多音频任务,社区活跃度高但更新稀疏 |
| GPT-SoVITS | 较高 | 专有 TTS | 专注 TTS,端到端,效果更专 |
| Bark | 高 | 端到端 Transformer | 文本直接转语音,部署更简单但功能单一 |
| MusicGen | 高 | 端到端 | 专注音乐生成,不是通用音频框架 |
AudioGPT 的差异化在于任务覆盖面广(语音+歌声+音频+虚拟人),但深度不如专做单一任务的模型。如果需要端到端效果更好的专有任务,选 Bark/GPT-SoVITS;需要用自然语言编排多音频任务链,选 AudioGPT。
一句话结论
AudioGPT 是一个用 LLM 统一调度多音频任务的框架,覆盖语音/歌声/音频/虚拟人四大方向,2023 年曾因概念爆款,但近年维护稀疏——适合做多模态 demo 编排,生产级使用需注意 WIP 状态和依赖模型的下载维护成本。
⚠️ Stars 10.2k 为 2026-08-18 当天数据(历史峰值,近年增长停滞)。download.sh 模型下载脚本在 2025 年 9 月有用户报告损坏,生产使用前请单独验证各模型权重可获取性。部分底层模型(如 Make-An-Audio、GeneFace)的预训练权重获取渠道未在仓库内明确说明,可能需要自行查找。