pierrenade/short-video-generator-AI · 上手攻略
- 仓库:pierrenade/short-video-generator-AI
- 链接:https://github.com/pierrenade/short-video-generator-AI
- 分类:trending
- 作者:Tom
- 更新:2026-09-08
是什么
pierrenade/short-video-generator-AI 是一个将 YouTube 视频或本地视频自动转化为竖屏短视频(Shorts / Reels)的开源工具,主打免费、无水印、AI 驱动的精彩片段提取 + 字幕 + 配音全流程一条龙。
它的核心链路是:输入 YouTube 链接(或本地视频)→ faster-whisper 字幕提取 → LLM 识别内容类型(播客/访谈/教程/Vlog 等)→ 基于病毒传播框架打分量级排序候选片段 → Auto-crop 竖屏渲染 → 可选 AI 生成 Hook 片头 → 输出成片。
适合不想付 OpusClip / Vidyo.ai 订阅费,但又需要批量产出短视频的内容创作者。
⚠️ 存疑:仓库 README 未注明具体使用了哪个病毒传播框架(virality framework),LLM 打分 0–100 的阈值未经外部基准验证,分数仅供参考。
解决什么问题
| 痛点 | 对应功能 |
|---|---|
| SaaS 工具(OpusClip/Vidyo.ai)要付费 | 100% 免费开源 |
| 片头有水印或 Pre-clip 致谢 | 无水印,无 Pre-clip |
| 手动找精彩片段费时 | LLM 自动打分量级排序 |
| 视频比例不对(横屏直接传质量差) | Auto-crop 竖屏(9:16)/ 方屏(1:1) |
| 想加 Hook 但不会写文案 | 可选 AI 生成 Hook 片头 |
| 翻译配音需求 | 支持多语言字幕 + 配音(需配置) |
快速安装
环境要求
- Python 3.10+
- 任意 LLM API key(OpenAI / Gemini / MuAPI 三选一)
- ⚠️ 推荐用虚拟环境隔离依赖
安装步骤
# 1. Clone
git clone https://github.com/pierrenade/short-video-generator-AI.git
cd short-video-generator-AI
# 2. 创建虚拟环境
python -m venv venv
# Windows:
venv\Scripts\activate
# Linux/Mac:
source venv/bin/activate
# 3. 安装依赖
pip install -r requirements.txt
# 4. 配置 .env(复制 .env.example 或新建 .env)
.env 配置示例:
# LLM 提供商:openai / gemini / muapi
LLM_PROVIDER=openai
# OpenAI
OPENAI_API_KEY=sk-xxxx
OPENAI_MODEL=gpt-4o-mini # 可选,默认 gpt-4o-mini
# 或者 Gemini
GEMINI_API_KEY=xxx
GEMINI_MODEL=gemini-2.5-flash # 可选
# 或者 MuAPI(按量计费,无需订阅)
MUAPI_API_KEY=xxx
# Whisper 设置(本地转录)
LOCAL_WHISPER_MODEL=base # tiny/base/small/medium/large-v3
LOCAL_WHISPER_DEVICE=auto # auto/cpu/cuda
⚠️ Gemini 有免费额度(每日限制),OpenAI 完全付费,MuAPI 按量计费无订阅。推荐先用 Gemini 试水。
核心用法
基本命令
# 最简用法(YouTube 链接)
python main.py "https://www.youtube.com/watch?v=video_id"
# 指定生成 3 条片段,竖屏,1080p
python main.py "https://www.youtube.com/watch?v=video_id" \
--n 3 \
--ratio 9:16 \
--resolution 1080
# 使用本地视频文件
python main.py "/path/to/video.mp4" \
--n 4 \
--ratio 9:16 \
--resolution 720 \
--language zh
常用参数
| 参数 | 默认值 | 说明 |
|---|---|---|
--n |
3 | 生成几条片段 |
--ratio |
9:16 | 竖屏/方屏;9:16 竖屏,1:1 方屏 |
--resolution |
720 | 源视频下载分辨率:360/480/720/1080 |
--language |
auto | Whisper 语言代码,如 zh、en |
--no-hook |
- | 禁用 AI Hook 片头 |
Web 界面
# 启动后端服务
python3 server.py
# 新开终端,启动前端
cd web
python3 -m http.server 8000
# 浏览器打开
http://localhost:8000/shorts-generator-ui.html
Web 界面支持批量排队多个视频、视觉化调节参数,适合不想用命令行的用户。
工作流程解析
输入视频(YouTube 或本地)
↓
faster-whisper 本地转录(生成带时间戳的字幕)
↓
LLM 识别内容类型(播客/访谈/教程/Vlog)+ 节奏分析
↓
LLM 扫描 transcript,通过"病毒传播框架"对每个片段打 0–100 分
→ Hook 时刻、情感高点、观点炸弹、揭露时刻、冲突、语录、故事高潮、实用价值
↓
去重(重叠片段按分数合并)
↓
取 Top-N(--n 参数)
↓
Auto-crop 竖屏渲染(可选加 AI Hook 片头)
↓
输出到 output/ 文件夹
⚠️ LLM 打分主观性:病毒传播框架的 0–100 打分依赖 LLM 自身判断,实测效果因模型而异;gpt-4o-mini 与 gemini-2.5-flash 打出分数可能不同。
典型适用场景
- YouTuber 批量产出 Shorts:把长视频自动切成多条精彩片段,一鱼多吃。
- 播客/访谈内容二创:提取播客中高光观点,生成竖屏短片段发小红书/抖音。
- 教程视频剪辑:从长教程中提取关键步骤片段,适合知识类账号。
- 无水印素材获取:竞品调研、内容分析时需要无水印视频片段。
- 多语言配音需求:搭配 Whisper 多语言模型,可生成外语字幕版本。
坑与注意
⚠️ YouTube 下载依赖 youtube-dl / yt-dlp:若视频有地区限制或被删,下载会失败,工具本身不负责绕过限制。
⚠️ Whisper 模型体积:large-v3 模型约 3GB,首次运行会自动下载;LOCAL_WHISPER_MODEL=base 适合配置低的机器(~1GB)。
⚠️ GPU 加速:有 NVIDIA GPU 时 LOCAL_WHISPER_DEVICE=cuda 可加速转录;无 GPU 用 CPU 较慢。
⚠️ API 费用:转录免费,但 LLM 调用按 token 计费;视频越长 transcript 越长,费用越高。建议 --n 不要设太大(默认 3 已足够)。
⚠️ Hook 功能需额外 LLM 调用:开启 Hook 会额外消耗 LLM token,介意费用请加 --no-hook。
⚠️ 无中文文档:README 为英文,配置和使用需要一定英文阅读能力。
⚠️ Web 界面不支持配置 API key:API key 必须在 .env 文件里配置,Web 界面只负责视频输入和参数调节。
与同类对比
| 工具 | 价格 | 水印 | 精彩片段检测 | 本地运行 | 多语言 |
|---|---|---|---|---|---|
| OpusClip | 付费订阅 | 无 | AI 驱动 | ❌ SaaS | ✅ |
| Vidyo.ai | 付费订阅 | 无 | AI 驱动 | ❌ SaaS | ✅ |
| short-video-generator-AI | 免费 | 无 | LLM 打分框架 | ✅ 纯本地 | ✅(Whisper) |
| CapCut Desktop | 免费 | 无 | 手动+AI辅助 | ✅ | ✅ |
核心优势:完全免费 + 本地运行 + 无水印 + 开源可审计。劣势是 UI 相对简陋、LLM 打分框架不透明、没有社媒直连发布功能。
一句话推荐结论
如果你需要免费、无水印、本地运行的 YouTube 视频转短视频工具,且能接受配置 LLM API key,pierrenade/short-video-generator-AI 是目前开源领域最干净的方案;适合有编程基础的内容创作者,不适合完全不想碰命令行的用户。
写作指引来源:W33–W36 lessons · 高分共性:GitHub 已验 + ⚠️ + 双轨 + fetch + abstract 核实;本篇已做 web_fetch 原始文档获取。