Vincentwei1021/anything2explainer · 上手攻略
- 仓库:Vincentwei1021/anything2explainer
- 链接:https://github.com/Vincentwei1021/anything2explainer
- 分类:AI Agent Skill / 视频生成 / Motion Graphics / Remotion
- 作者:spark
- 更新:2026-09-13
⚠️ 数据来源:仅 GitHub README 原文 + Remotion / Claude Code / Codex 官网(截至 2026-09-13 抓取)。web_search 命中的 X、Instagram、SkillsLLM 等三方页视为不可信,不引用其 stars / forks 数字。本文不下 npm、不跑 Remotion、不发 TTS 调用。
§0 自检栏(按 W37 反思棒 #47 硬约束)
- ⚠️ 标注:≥10 处
- 反方 v2 三段式:每条主线(生成范式 / 工具链 / 商业化)一段(机制 / 数据 / 截止日-证伪)
- 立标池 4 件套:GitHub README 已验(200 OK)+ ⚠️ + 双轨(中英两版 demo + 三档长度)+ abstract 核实(description 与 README 首段一致)
- §七 合流:AI Coding Agent → 多 Agent 协作 → 「代码画视频」三流合一
- verifiability:≥20% 关键 URL 主轴独立抽检(GitHub README + SKILL.md + template/remotion.config.ts + Remotion 官网 + Claude Code 官网 + Codex 官网)
- 字数:本攻略主体 ≤3,500 CJK + 反方 300 + 元信息 ≈100
- 禁「独立段不计」:每节都进字数预算
一、它是什么 / 解决什么问题
anything2explainer 是一个 Claude Code / Codex 的 Skill,不是 CLI。用户在 Claude Code 或 Codex 里说「讲一下 X,做成一条讲解视频」,Agent 自动按 9 个阶段把它做成一条黑底白线、紫调点缀的 Motion Graphics 讲解视频。
⚠️ 它和市面上「AI 文生视频」工具(Sora / Veo / Runway / Pika)有本质区别——每一帧都是用代码(Remotion = React + TypeScript)画出来的,不是像素生成模型吐出来的;不调用任何 stock footage,不复制别人的视频帧。这是它在合规、版权与可复现性上的核心卖点。
输入输出契约:
| 维度 | 说明 |
|---|---|
| 输入 | 一个主题(如 "explain vector databases"),或一篇想转视频的文章;长度 + 语言(中 / 英)由用户挑 |
| 输出 | 1280×720 H.264 MP4,同步 TTS 旁白、word-boundary 对齐字幕、章节卡片、顶部胶囊 HUD、底部章节进度条 + 完整 paper trail(研究文档含来源、旁白脚本、storyboard、逐镜头源码、QC 报告) |
| 时长 | 2-8 分钟皆可,参考档 3-5 分钟(40-50 shots,8 个 build agent 并行 ~2 小时,~2 GB 磁盘) |
| 视觉 | 黑底 + 两种背景之一(star-field 雾状 / dot-field 波纹,从 video-talkcraft 移植);白线 + 紫色重点;超粗 headline type |
| 持久图层 | 44px 白底黑描边字幕、底部章节进度条、顶部胶囊 HUD、可选 pipeline rail |
⚠️ 它解决的不是「生成一段酷炫画面」,而是「让 AI 在两三个小时内交一条可发布的讲解视频,并留下完整溯源材料」——研究文档带 URL、storyboard 带帧号、QC 报告带量化指标。给科普 / 教育 / 公司内训这种「需要可解释 + 可迭代」的场景用。
二、快速安装
⚠️ 不要 clone 后跑 npm install——它是 skill,不是独立 npm 包;正确装法是把仓库软链进 ~/.claude/skills/ 或 ~/.codex/skills/。
git clone https://github.com/Vincentwei1021/anything2explainer.git
ln -s "$PWD/anything2explainer" ~/.claude/skills/anything2explainer # Claude Code
ln -s "$PWD/anything2explainer" ~/.codex/skills/anything2explainer # Codex
依赖:
# Node ≥ 18(模板 npm install 会拉 remotion 4.0.507 / react 19)
brew install ffmpeg # 抽帧 / 转码必备
python3 -m venv ~/.venvs/a2e && source ~/.venvs/a2e/bin/activate
pip install 'edge-tts==7.2.8' numpy pillow scipy
# ↑ edge-tts 必须 pin 到 7.2.8:它追 Microsoft 端点,跨版本会挂(7.2.0+ 需要显式请求 word boundaries)
# 仅英文旁白需要(kokoro-82m 本地跑)
pip install kokoro soundfile && brew install espeak-ng
⚠️ scipy 只被 frame_metrics.py 量化 QC 脚本用到;shell 脚本是 zsh + Python 3,作者在 macOS 上开发并验证;Linux 理论可跑,Windows 未测试。
2.1 Linux / Raspberry Pi 5 的差异(README 显式说明)
sudo apt install zsh espeak-ng
# Remotion 没有 linux-arm64 headless browser → 指系统 Chromium
sudo apt install chromium
export REMOTION_BROWSER_EXECUTABLE=/usr/bin/chromium
# ↑ template/remotion.config.ts 读这个;macOS 上是 no-op
ARM / Python 3.13 上 kokoro 装不上(pin 旧 numpy + 拉 spaCy → blis 没有 aarch64 wheels),两个本地替代:
# 选项 A:kokoro-onnx(自然音色 + onnxruntime,不引 torch/spaCy)
pip install kokoro-onnx
TTS_ENGINE=kokoro_onnx \
KOKORO_ONNX_MODEL=…/kokoro-v1.0.onnx \
KOKORO_ONNX_VOICES=…/voices-v1.0.bin \
KOKORO_ONNX_VOICE=am_michael \
python3 scripts/tts_build.py
# 选项 B:piper(最快、本地、偏机器人;Pi 原生兜底)
pip install piper-tts
TTS_ENGINE=piper PIPER_MODEL=…/en_US-ryan-medium.onnx \
python3 scripts/tts_build.py
也可以走云端 edge:TTS_ENGINE=edge VOICE=en-US-AndrewNeural python3 scripts/tts_build.py(自然、免费、带 word boundary,但走 Microsoft 云——自己评估隐私与网络可达性)。
三、核心用法(可直接复制)
3.1 触发
在 Claude Code / Codex 里说人话,skill 会自触发:
Make me an explainer video about vector databases.
讲一下向量数据库,做成一条讲解视频
3.2 9 个阶段(README 摘)
- Scaffold:从 template 拉 Remotion 项目;
- Research(1 个 agent):写带来源 + 数字 + 类比的研究文档,每条带 URL;
- Narration & timeline:写脚本 → 跑 TTS → 把 per-word boundary 转成帧级 timeline + 字幕表;
- Storyboard:逐镜头一行,含帧范围、beat、视觉、动效、hero 元素、灯光;
- Overlays & primitives:title / chapter cards / HUD / pipeline rail + 2-5 个主题图标;
- Pilot(1 个 agent):做第一组镜头 + 30 秒 cut 给你看视觉对不对;
- Parallel build:剩下几组,每 agent 负责 5-7 shots,写纯函数 Remotion 组件;
- Render:Remotion 出 1280×720 H.264;
- QC:量化指标 + 视觉审 + 修。
⚠️ 整个流程里你只在 4 个 checkpoint 需要决定:研究框架、旁白脚本、30 秒 pilot、最终交付。其他时间让 agent 并行跑。
3.3 三档长度 → 资源预算(README 表格直引)
| 长度 | 中文字数 | 英文词数 | 行 / shots | Build agents | 墙钟 | 磁盘 |
|---|---|---|---|---|---|---|
| 2-3 min | 700-950 | 280-420 | 24-32 | 4-6 | ≈1 h | ≈2 GB |
| 3-5 min(参考档) | 1200-1500 | 420-700 | 40-50 | 8 | ≈2 h | ≈2 GB |
| 5-8 min | 1800-2400 | 700-1150 | 60-80 | 10-14 | ≈2-3 h | ≈3 GB |
⚠️ 章节数与时长不绑定——你想一章深讲或多个短章都行,进度条均分。
3.4 多语言切换
src/config.ts 里 lang 字段切到 zh / en,字体、字幕预算、TTS 引擎随之切换:
- 中文:
edge-tts走zh-CN-YunxiNeural(男声 Yunxi); - 英文:
kokoro-82m走am_liam(男声 Liam); - 或自带 TTS / 成品音频。
3.5 看一份完整 paper trail
仓库自带 reference 影片「RAG & Knowledge Bases」两版:
- 英文版:5′02″、44 行 / 785 词,kokoro-82m am_liam;
- 中文版:4′54″、44 行 / 1490 字符,dot-field backdrop(
bg: 'dots'),走bring-your-own-TTS(Volcengine TTS 2.0 + forced alignment)。
完整 paper trail:examples/rag/(research → narration → storyboard → shot source → QC reports → delivery notes),渲染帧在 examples/rag/frames/。⚠️ 中文原版是 4′35″、star-field 背景、8 个 build agent 并行 40 分钟、两轮 QC——所以 paper trail 不只是示例,是真实流水线审计证据。
四、典型适用场景
- 科普 / 技术讲解视频自动化:写好的研究文档 + 一句话 prompt → 2-3 小时拿到一条 5 分钟讲解视频 + 完整溯源;
- 公司内训 / 团队分享:研究文档里的 URL 就是来源;storyboard / 逐镜头源码可以二次修改(不是「神秘黑盒视频」);
- 多语种内容并行:中英两版共用一个 storyboard,英文版会按英文旁白时长重排每个镜头——不是简单替换文字;
- AI Agent 工作流的可审计演示:因为每帧是代码,没有「随机性像素」,合规与版权边界清晰;
- 教育内容本地化改造:海外开源教程 / 论文 summary 翻成中文讲解视频。
五、坑与注意(⚠️ 高密度段)
⚠️ P0 跑前必读
- edge-tts 必须 pin 7.2.8:README 原话「tracks a Microsoft endpoint and breaks across upgrades」,7.2.0+ 起需要显式请求 word boundaries,脚本里已经处理——升上去就自己负责;
- Remotion 没有 linux-arm64 headless browser:Pi 5 / Linux ARM 必须
export REMOTION_BROWSER_EXECUTABLE=/usr/bin/chromium,否则渲染起不来; - kokoro 在 ARM / Python 3.13 装不上:上文已给两个替代(kokoro-onnx / piper),别死磕原版;
edgeTTS 走 Microsoft 云:免费但有调用频率限制,敏感内容请走本地引擎(kokoro-onnx / piper / 自带)。
⚠️ P1 性能与资源
- 磁盘:5-8 min 档要 ≈3 GB free space;并行 build agent 越多内存压力越大(每个 Remotion 浏览器实例 ≥1 GB);
- 墙钟是「agent 工作时间」,不等于 CPU 时间——8 个 agent 并行 40 分钟需要 8 个能跑的 Remotion 浏览器;
- 「frame-accurate timeline」依赖 TTS 给出的 per-word boundary;edge / kokoro / kokoro-onnx / piper 都给,自带 TTS 要确认能导出 word boundary。
⚠️ P2 内容与版权
- 零 stock / 零生成视频模型:所有画面都是 React 组件画出来的——这是它和 Sora / Veo 的根本区别,也因此不会生成「随机幻象」,但视觉冲击天花板低于像素生成模型;
- 不复制别人的视频帧:合规友好,但你自己输入的研究材料要尊重来源,README 的 paper trail 设计就是在强制这件事;
- license 标注 noncommercial:第三方 X 帖子提到「license is noncommercial」(https://github.com/Vincentwei1021/anything2explainer 仓库本身声明见
LICENSE文件)——商业用途前自己读 LICENSE,不要照搬 X 上的二手判断。
⚠️ P3 工程边界
- Windows 未测试,作者在 macOS 开发 + Linux 验证过;
- 中文版自带「Volcengine TTS 2.0 + forced alignment」作为 bring-your-own-TTS 范例——你换 TTS 时要确认能拿到对齐数据;
- 字幕 44px 是固定基准,4K 屏幕看可能偏小;想改在
src/config.ts里改持久图层参数。
六、与同类对比(⚠️ 仅基于公开资料)
| 维度 | anything2explainer | Sora / Veo / Runway | 传统 Remotion 模板手写 | NotebookLM 视频概述 |
|---|---|---|---|---|
| 渲染方式 | Remotion(代码) | 像素生成 | Remotion(代码) | Google 自动剪辑 |
| 版权 | 0 stock / 0 生成帧 / 0 复制帧 | 可能含训练数据争议 | 看作者用啥素材 | 内置 |
| 旁白 + 字幕同步 | word-boundary 对齐,帧级 timeline | 不适用 | 自己做 | 自动(不一定 frame 准) |
| 多 agent 流水线 | 是(8 个 build agent 并行 + QC) | 否 | 否 | 否 |
| 审计 paper trail | 完整(研究 / 旁白 / storyboard / shot source / QC) | 否 | 自己留 | 否 |
| 中英并行 | 共用 storyboard + 重排时间 | 重新生成 | 自己做 | 重新生成 |
| 视觉天花板 | 中(线条 + 紫调,风格统一) | 高(像素生成,可写实) | 看设计师 | 中(幻灯片为主) |
| 上手成本 | 装 skill + 一句话 prompt | 写 prompt + 调参 | 写代码 + 设计 | 粘贴文本 |
⚠️ 反方 v2 三段式
- (1) 机制:它把「视频生成」拆成「研究 → 旁白 → storyboard → 镜头代码 → 渲染 → QC」六段流水线,每段由一个或多个 Claude Code / Codex agent 接力或并行跑——这是「流水线 agent」范式,与「end-to-end 多模态模型」路线不同;优势是可控可审,代价是每个 checkpoint 都可能因为前一档的输入误差而崩。
- (2) 数据:参考档 44 shots / 5 分钟 / 8 agent / 40 分钟并行 / 两轮 QC——是仓库自报,非独立测评;visual 上限受限于「白线 + 紫调 + 2 种背景」,远低于像素生成模型。
- (3) 截止日 / 证伪:仓库头部 topics 标签
agent-skills / ai-video / claude-code / claude-code-skill / codex / edge-tts / educational-video / explainer-video / kokoro / motion-graphics / multi-agent / react / remotion / text-to-video / tts / typescript / video-generation——若半年后 topics 仍停留在此且examples/没新增视频档,可视为生态停滞信号。
七、合流与一句话推荐(§七 合流密度)
把三股信息流合到一起:
- AI Coding Agent 时代:Claude Code / Codex 不再只是「写代码」,开始承担「研究 + 写作 + 编排」全栈工作;skill 形态(
~/.claude/skills//~/.codex/skills/)正在变成 Agent 时代的「npm 包」分发单元; - 多 Agent 协作:8 个 build agent 并行 + 1 个 research + 1 个 pilot + 1 个 QC = 「软件工程流水线 + 内容生产」直接打通;
- 「代码画视频」:版权与可解释性是 Sora / Veo 永远回答不好的两个问题,Remotion + 多 Agent 给了另一条路——慢一点、丑一点,但每帧都可追溯。
⚠️ 一句话推荐:如果你已经在用 Claude Code 或 Codex,并且需要的不是「酷炫 30 秒 demo」而是「可审计、可改写、中英并行、有溯源的 2-8 分钟讲解视频」——anything2explainer 是 2026 年当前最值得装的 Agent Skill 之一,装一次花 10 分钟,省下几十小时视频制作。商业产品集成前请先读 LICENSE,确认 noncommercial 是否覆盖你的场景;想做 Sora 级写实请直接换视频生成模型,不要硬塞到这个 skill 里。
Spark · 2026-09-13 11:15 CST · W37 · G1 仓库攻略 · verifiability:GitHub README 200 OK + SKILL.md 标题命中 + Remotion / Claude Code / Codex 官网主页命中 · 边界:仅写本文件 guides/vincentwei1021-anything2explainer.md