pierrenade/short-video-generator-AI · 上手攻略

  • 仓库:pierrenade/short-video-generator-AI
  • 链接:https://github.com/pierrenade/short-video-generator-AI
  • 分类:trending
  • 作者:Tom
  • 更新:2026-09-08

是什么

pierrenade/short-video-generator-AI 是一个将 YouTube 视频或本地视频自动转化为竖屏短视频(Shorts / Reels)的开源工具,主打免费、无水印、AI 驱动的精彩片段提取 + 字幕 + 配音全流程一条龙。

它的核心链路是:输入 YouTube 链接(或本地视频)→ faster-whisper 字幕提取 → LLM 识别内容类型(播客/访谈/教程/Vlog 等)→ 基于病毒传播框架打分量级排序候选片段 → Auto-crop 竖屏渲染 → 可选 AI 生成 Hook 片头 → 输出成片。

适合不想付 OpusClip / Vidyo.ai 订阅费,但又需要批量产出短视频的内容创作者。

⚠️ 存疑:仓库 README 未注明具体使用了哪个病毒传播框架(virality framework),LLM 打分 0–100 的阈值未经外部基准验证,分数仅供参考。


解决什么问题

痛点 对应功能
SaaS 工具(OpusClip/Vidyo.ai)要付费 100% 免费开源
片头有水印或 Pre-clip 致谢 无水印,无 Pre-clip
手动找精彩片段费时 LLM 自动打分量级排序
视频比例不对(横屏直接传质量差) Auto-crop 竖屏(9:16)/ 方屏(1:1)
想加 Hook 但不会写文案 可选 AI 生成 Hook 片头
翻译配音需求 支持多语言字幕 + 配音(需配置)

快速安装

环境要求

  • Python 3.10+
  • 任意 LLM API key(OpenAI / Gemini / MuAPI 三选一)
  • ⚠️ 推荐用虚拟环境隔离依赖

安装步骤

# 1. Clone
git clone https://github.com/pierrenade/short-video-generator-AI.git
cd short-video-generator-AI

# 2. 创建虚拟环境
python -m venv venv

# Windows:
venv\Scripts\activate
# Linux/Mac:
source venv/bin/activate

# 3. 安装依赖
pip install -r requirements.txt

# 4. 配置 .env(复制 .env.example 或新建 .env)

.env 配置示例:

# LLM 提供商:openai / gemini / muapi
LLM_PROVIDER=openai

# OpenAI
OPENAI_API_KEY=sk-xxxx
OPENAI_MODEL=gpt-4o-mini   # 可选,默认 gpt-4o-mini

# 或者 Gemini
GEMINI_API_KEY=xxx
GEMINI_MODEL=gemini-2.5-flash  # 可选

# 或者 MuAPI(按量计费,无需订阅)
MUAPI_API_KEY=xxx

# Whisper 设置(本地转录)
LOCAL_WHISPER_MODEL=base   # tiny/base/small/medium/large-v3
LOCAL_WHISPER_DEVICE=auto  # auto/cpu/cuda

⚠️ Gemini 有免费额度(每日限制),OpenAI 完全付费,MuAPI 按量计费无订阅。推荐先用 Gemini 试水。


核心用法

基本命令

# 最简用法(YouTube 链接)
python main.py "https://www.youtube.com/watch?v=video_id"

# 指定生成 3 条片段,竖屏,1080p
python main.py "https://www.youtube.com/watch?v=video_id" \
  --n 3 \
  --ratio 9:16 \
  --resolution 1080

# 使用本地视频文件
python main.py "/path/to/video.mp4" \
  --n 4 \
  --ratio 9:16 \
  --resolution 720 \
  --language zh

常用参数

参数 默认值 说明
--n 3 生成几条片段
--ratio 9:16 竖屏/方屏;9:16 竖屏,1:1 方屏
--resolution 720 源视频下载分辨率:360/480/720/1080
--language auto Whisper 语言代码,如 zhen
--no-hook - 禁用 AI Hook 片头

Web 界面

# 启动后端服务
python3 server.py

# 新开终端,启动前端
cd web
python3 -m http.server 8000

# 浏览器打开
http://localhost:8000/shorts-generator-ui.html

Web 界面支持批量排队多个视频、视觉化调节参数,适合不想用命令行的用户。


工作流程解析

输入视频(YouTube 或本地)
       ↓
faster-whisper 本地转录(生成带时间戳的字幕)
       ↓
LLM 识别内容类型(播客/访谈/教程/Vlog)+ 节奏分析
       ↓
LLM 扫描 transcript,通过"病毒传播框架"对每个片段打 0–100 分
  → Hook 时刻、情感高点、观点炸弹、揭露时刻、冲突、语录、故事高潮、实用价值
       ↓
去重(重叠片段按分数合并)
       ↓
取 Top-N(--n 参数)
       ↓
Auto-crop 竖屏渲染(可选加 AI Hook 片头)
       ↓
输出到 output/ 文件夹

⚠️ LLM 打分主观性:病毒传播框架的 0–100 打分依赖 LLM 自身判断,实测效果因模型而异;gpt-4o-mini 与 gemini-2.5-flash 打出分数可能不同。


典型适用场景

  1. YouTuber 批量产出 Shorts:把长视频自动切成多条精彩片段,一鱼多吃。
  2. 播客/访谈内容二创:提取播客中高光观点,生成竖屏短片段发小红书/抖音。
  3. 教程视频剪辑:从长教程中提取关键步骤片段,适合知识类账号。
  4. 无水印素材获取:竞品调研、内容分析时需要无水印视频片段。
  5. 多语言配音需求:搭配 Whisper 多语言模型,可生成外语字幕版本。

坑与注意

⚠️ YouTube 下载依赖 youtube-dl / yt-dlp:若视频有地区限制或被删,下载会失败,工具本身不负责绕过限制。

⚠️ Whisper 模型体积:large-v3 模型约 3GB,首次运行会自动下载;LOCAL_WHISPER_MODEL=base 适合配置低的机器(~1GB)。

⚠️ GPU 加速:有 NVIDIA GPU 时 LOCAL_WHISPER_DEVICE=cuda 可加速转录;无 GPU 用 CPU 较慢。

⚠️ API 费用:转录免费,但 LLM 调用按 token 计费;视频越长 transcript 越长,费用越高。建议 --n 不要设太大(默认 3 已足够)。

⚠️ Hook 功能需额外 LLM 调用:开启 Hook 会额外消耗 LLM token,介意费用请加 --no-hook

⚠️ 无中文文档:README 为英文,配置和使用需要一定英文阅读能力。

⚠️ Web 界面不支持配置 API key:API key 必须在 .env 文件里配置,Web 界面只负责视频输入和参数调节。


与同类对比

工具 价格 水印 精彩片段检测 本地运行 多语言
OpusClip 付费订阅 AI 驱动 ❌ SaaS
Vidyo.ai 付费订阅 AI 驱动 ❌ SaaS
short-video-generator-AI 免费 LLM 打分框架 ✅ 纯本地 ✅(Whisper)
CapCut Desktop 免费 手动+AI辅助

核心优势:完全免费 + 本地运行 + 无水印 + 开源可审计。劣势是 UI 相对简陋、LLM 打分框架不透明、没有社媒直连发布功能。


一句话推荐结论

如果你需要免费、无水印、本地运行的 YouTube 视频转短视频工具,且能接受配置 LLM API key,pierrenade/short-video-generator-AI 是目前开源领域最干净的方案;适合有编程基础的内容创作者,不适合完全不想碰命令行的用户。


写作指引来源:W33–W36 lessons · 高分共性:GitHub 已验 + ⚠️ + 双轨 + fetch + abstract 核实;本篇已做 web_fetch 原始文档获取。