AIGC-Audio/AudioGPT · 上手攻略

  • 仓库:AIGC-Audio/AudioGPT
  • 链接:https://github.com/AIGC-Audio/AudioGPT
  • 分类:AI 音频 · 多模态生成
  • 作者:Tom
  • 更新:2026-08-18

这是什么

AudioGPT是由 AIGC-Audio 团队开源的多模态音频理解和生成框架,发布于 2023 年 4 月(arXiv:2304.12995)。其核心设计思路是:将 LLM(大语言模型)作为音频任务的统一调度层,底层对接各类音频/语音专有的预训练基础模型(Foundation Models),用户通过自然语言 Prompt 控制音频生成与理解任务。

GitHub 现状(2026-08-18):Stars 10.2k / Forks 850,代码主语言 Python,2024 年 7 月仍有 commit 更新(距今约 2 年无大版本更新)。


解决什么问题

传统音频模型通常只能做单一任务(TTS、ASR、歌声合成各自独立),AudioGPT 的设计目标是通过 LLM 的指令理解能力,将这些专有模型统一调度,用户说一句话就能触发多个音频任务。例如:

  • "请把这段中文语音转换成英文语音" → TTS + 语音翻译
  • "为这张图片生成配套的背景音乐" → Image Captioning + Text-to-Audio
  • "生成一段演讲视频(Talking Head)" → TTS + GeneFace

本质上,它解决的是多模态音频任务编排的问题,而不是做底层模型。


支持的任务类型

语音类(Speech)

任务 支持的 Foundation Models 状态
文本转语音(TTS) FastSpeech2、SyntaSpeech、VITS Yes (WIP)
风格迁移 GenerSpeech Yes
语音识别(ASR) Whisper、Conformer Yes
语音增强 ConvTasNet Yes (WIP)
语音分离 TF-GridNet Yes (WIP)
语音翻译 Multi-decoder WIP
单声道转双耳 NeuralWarp Yes

歌唱类(Sing)

任务 支持的 Foundation Models 状态
文本转歌声 DiffSinger、VISinger Yes (WIP)

音频类(Audio)

任务 支持的 Foundation Models 状态
文本转音频 Make-An-Audio Yes
音频修补 Make-An-Audio Yes
图像转音频 Make-An-Audio Yes
声音检测 Audio-transformer(HTS-Audio-Transformer) Yes
目标声音检测 TSDNet Yes
声音提取 LASSNet Yes

虚拟人合成(Talking Head)

任务 支持的 Foundation Models 状态
说话人脸合成 GeneFace Yes (WIP)

快速安装

环境准备

# 创建 conda 环境(Python 3.8)
conda create -n audiogpt python=3.8
conda activate audiogpt

# 安装基础依赖
pip install -r requirements.txt

下载基础模型

# 下载所需的基础模型(按需下载,不是所有模型都需要)
bash download.sh

配置 API Key 并启动

# 设置 OpenAI API Key(或兼容的 API)
export OPENAI_API_KEY={Your_Private_OpenAI_Key}

# 启动 AudioGPT
python audio-chatgpt.py

⚠️ download.sh 涉及的模型下载需网络通畅;部分基础模型(如 VITS、Whisper)来自第三方仓库,若下载脚本失效需手动从各模型官方仓库获取权重。


核心用法

基础调用流程

# audio-chatgpt.py 核心逻辑示意
import os
from audio_chatgpt import AudioGPT

# 初始化,设置 OpenAI API Key
os.environ["OPENAI_API_KEY"] = "your-key-here"
agent = AudioGPT()

# 自然语言请求音频任务
response = agent.chat("请将以下文本转为语音:今天天气真好")
print(response)

依赖的底层模型(部分)

AudioGPT 本身不训练底座模型,依赖这些开源模型(需自行下载权重):

# TTS 模型(VITS 示例)
git clone https://github.com/jaywalnut310/vits.git

# Whisper 语音识别
# 来自 openai/whisper 官方

# Make-An-Audio(文本转音频)
# 来自 audio/AIGC-Audio/AudioGPT 仓库内嵌

Talking Head 生成

# GeneFace 说话人脸合成
# 依赖:音频 + 人脸图像 → 输出说话视频
git clone https://github.com/yerfor/GeneFace.git

典型适用场景

  1. 多模态 demo 快速搭建:想做语音+音频+虚拟人多模态 demo,用 AudioGPT 做调度层比自己接各个模型快
  2. 音频任务链编排:需要语音识别→翻译→TTS 的完整链条,自然语言描述即可触发
  3. 学术研究基线:arXiv 论文官方代码仓库,可复现论文结果
  4. 多模型对比:同一任务切换不同 Foundation Model 对比效果

坑与注意

说明
主模型需额外下载 download.sh 下载的模型权重经常因网络问题失败,部分模型需手动从 Google Drive/百度网盘获取
WIP 状态多 多数任务标注 Yes (WIP),实际运行可能不稳定;TTS 和 Talking Head 均属 WIP
2024 年后基本停更 Stars 10.2k 主要是 2023 年爆款期的历史积累,2024 年中后 commit 稀少
OpenAI API 强依赖 核心调度层是 LLM,必须有 OpenAI API Key(或兼容 API),离线场景不可用
没有 S2S(Speech-to-Speech) Issue #100 反映此问题至今仍是 open 状态
下载脚本损坏 Issue #104(Sep 2025)反映所有下载 bash 文件损坏/报错

与同类对比

方案 Stars 架构 特点
AudioGPT 10.2k LLM 调度 + 专有模型 自然语言控制多音频任务,社区活跃度高但更新稀疏
GPT-SoVITS 较高 专有 TTS 专注 TTS,端到端,效果更专
Bark 端到端 Transformer 文本直接转语音,部署更简单但功能单一
MusicGen 端到端 专注音乐生成,不是通用音频框架

AudioGPT 的差异化在于任务覆盖面广(语音+歌声+音频+虚拟人),但深度不如专做单一任务的模型。如果需要端到端效果更好的专有任务,选 Bark/GPT-SoVITS;需要用自然语言编排多音频任务链,选 AudioGPT。


一句话结论

AudioGPT 是一个用 LLM 统一调度多音频任务的框架,覆盖语音/歌声/音频/虚拟人四大方向,2023 年曾因概念爆款,但近年维护稀疏——适合做多模态 demo 编排,生产级使用需注意 WIP 状态和依赖模型的下载维护成本。


⚠️ Stars 10.2k 为 2026-08-18 当天数据(历史峰值,近年增长停滞)。download.sh 模型下载脚本在 2025 年 9 月有用户报告损坏,生产使用前请单独验证各模型权重可获取性。部分底层模型(如 Make-An-Audio、GeneFace)的预训练权重获取渠道未在仓库内明确说明,可能需要自行查找。