modstart-lib/aigcpanel · 上手攻略
- 仓库:modstart-lib/aigcpanel
- 链接:https://github.com/modstart-lib/aigcpanel
- 分类:ai-application
- 作者:Tom
- 更新:2026-08-10
这是什么
AIGCPanel 是一款一站式 AI 数字人桌面应用,支持 Windows / macOS / Linux 三平台,定位是让没有深厚技术背景的普通用户也能快速上手本地 AI 模型,生成数字人视频、合成 / 克隆声音、操作 25+ 音视频处理工具。软件基于 Electron + Vue 3 + TypeScript 构建,数据存储使用 better-sqlite3,无需联网即可离线运行核心功能(模型需本地部署)。
核心能力分为四大模块:数字人视频合成(多模型口型同步)、语音处理(TTS / 克隆 / ASR)、工具箱(25+ 音视频工具)、VIP 可视化工作流(拖拽编排 AI 流水线)。
解决什么问题
AI 数字人内容创作有几个壁垒: - 需要分别部署 MuseTalk、Wav2Lip、GPT-SoVITS 等多个开源模型,各自接口不同 - 音视频处理工具分散在多个软件间切换,流程割裂 - 没有编程经验的用户难以整合本地模型到生产流程 - 直播场景需要实时弹幕互动能力,缺乏一站式方案
AIGCPanel 通过内置模型市场(一键下载启动包)、统一 UI 和 CLI,把上述痛点封装成"下载→安装→点按钮出结果"的体验。
快速安装
官方预编译包(推荐)
直接从 aigcpanel.com 下载对应平台的安装包,无需手动安装依赖。
| 平台 | 格式 | 安装方式 |
|---|---|---|
| Windows | .exe |
双击安装,无需额外配置 |
| macOS | .dmg |
拖入 Applications;Intel + Apple Silicon 均支持 |
| Linux | .AppImage |
chmod +x AIGCPanel.AppImage && ./AIGCPanel.AppImage |
| Linux | .deb |
sudo dpkg -i AIGCPanel.deb |
⚠️ macOS 首次运行提示"来自未知开发者":在「系统设置 → 隐私与安全性」点击「仍要打开」。
从源码构建(Node.js 20+)
git clone https://github.com/modstart-lib/aigcpanel.git
cd aigcpanel
npm install
# 开发模式
npm run dev
# 编译检查(TypeScript 无报错)
npm run build:preview
# 完整打包
npm run build
打包产物在 dist/ 目录,包含各平台可执行文件和 dist-cli/ 子目录(CLI 工具)。
核心用法
数字人视频合成
- 在「模型管理」中下载所需口型模型的一键启动包(MuseTalk / LatentSync / Wav2Lip / Heygem)
- 进入「数字人合成」,上传人物视频(支持绿幕视频)
- 输入文本或上传本地音频文件
- 选择口型同步模型,点击生成
支持的驱动方式: - 文本输入 → 语音模型合成音频 → 驱动口型 - 直接上传音频文件 → 驱动口型
内置形象模板管理,支持普通视频和绿幕视频两种模式。
语音处理(TTS / 克隆 / ASR)
语音合成(TTS)
支持多模型(CosyVoice-300M、CosyVoice-300M-Instruct、CosyVoice2-0.5b、FishSpeech、IndexTTS、SparkTTS),可调速度和音调,任务列表支持批量下载。
语音克隆
上传参考音频(建议 10s 以上清晰人声),选择克隆模型(GPT-SoVITS 少样本克隆、FishSpeech 零样本克隆),生成特定音色的合成音频。
语音识别(ASR)
基于 FunASR(阿里达摩院开源),输出带时间戳的文字,可导出 SRT/ASS 字幕文件。
工具箱(25+ 音视频工具)
无需 Pro 账号即可使用,涵盖:
| 类别 | 工具 |
|---|---|
| 声音处理 | 长文本转音频、字幕转音频、声音识别(ASR,含时间戳/字幕导出)、声音替换、音频规范化 |
| 图像生成 | 文生图、图生图 |
| 视频处理 | 背景添加、智能剪辑、片段放大、标注、字幕、全局变速、片段变速、尺寸转换、压缩、片段删除/保留、片头片尾合并、添加音频、视频合并、格式转换、FFmpeg 自定义 |
| 一键合成流程 | ⚡ 将上述多个工具串联成单次操作 |
VIP 可视化工作流编排(Pro)
拖拽式节点编排,节点类型:
| 节点 | 说明 |
|---|---|
| 大模型(LLM) | 调用配置的 AI 模型生成文本 |
| JS 脚本 | 执行自定义 JavaScript 逻辑 |
| 条件分支 | 根据条件控制流程走向 |
| MCP 工具调用 | 调用 MCP 协议工具 |
| 文件操作 | 复制、移动、列表读取 |
| 变量 / 随机值 | 定义变量或生成随机数据 |
| 正则提取 | 从文本中提取结构化内容 |
| 工具节点 | 直接调用工具箱内任意工具 |
支持断点续跑和节点级状态追踪、运行历史查看。
智能直播(Pro)
- 多平台弹幕监控:抖音、哔哩哔哩、虎牙、斗鱼、快手
- 知识库配置:问答流程、视频播放流程、自定义内容
- 违禁词检测与回复 Prompt 自定义
- 互动事件记录与播报历史查看
CLI 工具
在软件「设置 → 命令行工具」界面一键安装到系统 PATH,或手动将 dist-cli/ 目录下的可执行文件加入 PATH。
# 查看帮助
aigcpanel --help
# 查询可用模型
aigcpanel model list
# 调用模型函数
aigcpanel model call <modelName> <function> [args...]
技术栈一览
| 技术 | 用途 |
|---|---|
| Electron | 跨平台桌面应用框架 |
| Vue 3 + TypeScript | 前端 UI |
| Arco Design(字节跳动) | UI 组件库 |
| TailwindCSS | 原子化 CSS |
| Vite | 构建工具 |
| better-sqlite3 | 本地数据持久化 |
| LogicFlow | 工作流画布引擎(节点编排) |
运行环境:Node.js 20 及以上
典型适用场景
| 场景 | 推荐功能 |
|---|---|
| 快速制作口型同步的数字人短视频 | 数字人合成(MuseTalk 模式) |
| 用少量音频样本克隆特定音色做 TTS | 语音克隆(GPT-SoVITS) |
| 为视频自动添加字幕(SRT 格式) | 工具箱 → 声音识别(ASR) |
| 快速生成多语言产品介绍视频 | 数字人合成 + TTS + 字幕工具组合 |
| 个人 / 小团队数字人 IP 运营 | 数字人合成 + 工作流编排(Pro) |
| 直播弹幕实时互动 | 智能直播(Pro) |
坑与注意
- VIP 功能需付费:可视化工作流编排和智能直播属于 Pro 功能,免费版可用数字人合成和工具箱核心能力。
- 模型下载需要网络:模型市场提供一键启动包,但模型权重本身仍需下载(总大小较大),国内用户注意网络条件。
- macOS Apple Silicon 兼容性:README 称支持 M 系列芯片,首次运行需手动授权"仍要打开"。
- Linux 无 CLI 一键安装:Linux 用户需手动将
dist-cli/可执行文件加入 PATH,比 macOS/Windows 的图形界面设置多一步。 - 数字人视频质量依赖上游模型:MuseTalk / LatentSync / Wav2Lip 的效果各有优劣,Heygem 是全身数字人驱动(非口型同步),选型时按需求场景区分。
- 工具箱 FFmpeg 自定义节点:需要了解 FFmpeg 命令行参数,对非技术用户有一定门槛。
与同类对比
| 方案 | 定位 | 优势 | 局限 |
|---|---|---|---|
| AIGCPanel | 桌面应用(Electron) | 开源、一站式、本地运行、无编程门槛 | VIP 功能付费、AI 模型需自行下载 |
| D-ID | 云服务(闭源 SaaS) | 质量高、无需配置 | 收费、需联网、数据上传云端 |
| Heygen | 云 SaaS | 效果成熟、商业生态完善 | 订阅制、不开源 |
| 腾讯智影 | 云 SaaS(国内) | 中文体验好、本土化 | 需注册账号、非开源 |
| MuseTalk(开源自部署) | 开源模型 | 完全可控、免费 | 需要分别部署多个模型、无 UI |
AIGCPanel 的核心差异化:介于开源模型自部署(零碎但免费)和商业 SaaS(省心但付费)之间,用 Electron 桌面应用封装开源模型矩阵,提供统一 UI + 一键模型管理,降低数字人内容创作的配置门槛。
一句话推荐结论
需要本地部署、免编程管理多个 AI 数字人模型(口型 / 语音克隆 / 工具箱)的一站式工具,AIGCPanel 是目前开源方案里 UI 最完整、模型接入最全的选择——适合个人创作者和小型团队快速出数字人内容。