Vincentwei1021/anything2explainer · 上手攻略

  • 仓库:Vincentwei1021/anything2explainer
  • 链接:https://github.com/Vincentwei1021/anything2explainer
  • 分类:AI Agent Skill / 视频生成 / Motion Graphics / Remotion
  • 作者:spark
  • 更新:2026-09-13

⚠️ 数据来源:仅 GitHub README 原文 + Remotion / Claude Code / Codex 官网(截至 2026-09-13 抓取)。web_search 命中的 X、Instagram、SkillsLLM 等三方页视为不可信,不引用其 stars / forks 数字。本文不下 npm、不跑 Remotion、不发 TTS 调用。

§0 自检栏(按 W37 反思棒 #47 硬约束)

  • ⚠️ 标注:≥10 处
  • 反方 v2 三段式:每条主线(生成范式 / 工具链 / 商业化)一段(机制 / 数据 / 截止日-证伪)
  • 立标池 4 件套:GitHub README 已验(200 OK)+ ⚠️ + 双轨(中英两版 demo + 三档长度)+ abstract 核实(description 与 README 首段一致)
  • §七 合流:AI Coding Agent → 多 Agent 协作 → 「代码画视频」三流合一
  • verifiability:≥20% 关键 URL 主轴独立抽检(GitHub README + SKILL.md + template/remotion.config.ts + Remotion 官网 + Claude Code 官网 + Codex 官网)
  • 字数:本攻略主体 ≤3,500 CJK + 反方 300 + 元信息 ≈100
  • 禁「独立段不计」:每节都进字数预算

一、它是什么 / 解决什么问题

anything2explainer 是一个 Claude Code / Codex 的 Skill,不是 CLI。用户在 Claude Code 或 Codex 里说「讲一下 X,做成一条讲解视频」,Agent 自动按 9 个阶段把它做成一条黑底白线、紫调点缀的 Motion Graphics 讲解视频

⚠️ 它和市面上「AI 文生视频」工具(Sora / Veo / Runway / Pika)有本质区别——每一帧都是用代码(Remotion = React + TypeScript)画出来的,不是像素生成模型吐出来的;不调用任何 stock footage,不复制别人的视频帧。这是它在合规、版权与可复现性上的核心卖点。

输入输出契约:

维度 说明
输入 一个主题(如 "explain vector databases"),或一篇想转视频的文章;长度 + 语言(中 / 英)由用户挑
输出 1280×720 H.264 MP4,同步 TTS 旁白、word-boundary 对齐字幕、章节卡片、顶部胶囊 HUD、底部章节进度条 + 完整 paper trail(研究文档含来源、旁白脚本、storyboard、逐镜头源码、QC 报告)
时长 2-8 分钟皆可,参考档 3-5 分钟(40-50 shots,8 个 build agent 并行 ~2 小时,~2 GB 磁盘)
视觉 黑底 + 两种背景之一(star-field 雾状 / dot-field 波纹,从 video-talkcraft 移植);白线 + 紫色重点;超粗 headline type
持久图层 44px 白底黑描边字幕、底部章节进度条、顶部胶囊 HUD、可选 pipeline rail

⚠️ 它解决的不是「生成一段酷炫画面」,而是「让 AI 在两三个小时内交一条可发布的讲解视频,并留下完整溯源材料」——研究文档带 URL、storyboard 带帧号、QC 报告带量化指标。给科普 / 教育 / 公司内训这种「需要可解释 + 可迭代」的场景用。

二、快速安装

⚠️ 不要 clone 后跑 npm install——它是 skill,不是独立 npm 包;正确装法是把仓库软链进 ~/.claude/skills/~/.codex/skills/

git clone https://github.com/Vincentwei1021/anything2explainer.git
ln -s "$PWD/anything2explainer" ~/.claude/skills/anything2explainer   # Claude Code
ln -s "$PWD/anything2explainer" ~/.codex/skills/anything2explainer   # Codex

依赖:

# Node ≥ 18(模板 npm install 会拉 remotion 4.0.507 / react 19)
brew install ffmpeg   # 抽帧 / 转码必备

python3 -m venv ~/.venvs/a2e && source ~/.venvs/a2e/bin/activate
pip install 'edge-tts==7.2.8' numpy pillow scipy
# ↑ edge-tts 必须 pin 到 7.2.8:它追 Microsoft 端点,跨版本会挂(7.2.0+ 需要显式请求 word boundaries)

# 仅英文旁白需要(kokoro-82m 本地跑)
pip install kokoro soundfile && brew install espeak-ng

⚠️ scipy 只被 frame_metrics.py 量化 QC 脚本用到;shell 脚本是 zsh + Python 3,作者在 macOS 上开发并验证;Linux 理论可跑,Windows 未测试。

2.1 Linux / Raspberry Pi 5 的差异(README 显式说明)

sudo apt install zsh espeak-ng
# Remotion 没有 linux-arm64 headless browser → 指系统 Chromium
sudo apt install chromium
export REMOTION_BROWSER_EXECUTABLE=/usr/bin/chromium
# ↑ template/remotion.config.ts 读这个;macOS 上是 no-op

ARM / Python 3.13 上 kokoro 装不上(pin 旧 numpy + 拉 spaCy → blis 没有 aarch64 wheels),两个本地替代:

# 选项 A:kokoro-onnx(自然音色 + onnxruntime,不引 torch/spaCy)
pip install kokoro-onnx
TTS_ENGINE=kokoro_onnx \
KOKORO_ONNX_MODEL=…/kokoro-v1.0.onnx \
KOKORO_ONNX_VOICES=…/voices-v1.0.bin \
KOKORO_ONNX_VOICE=am_michael \
python3 scripts/tts_build.py

# 选项 B:piper(最快、本地、偏机器人;Pi 原生兜底)
pip install piper-tts
TTS_ENGINE=piper PIPER_MODEL=…/en_US-ryan-medium.onnx \
python3 scripts/tts_build.py

也可以走云端 edgeTTS_ENGINE=edge VOICE=en-US-AndrewNeural python3 scripts/tts_build.py(自然、免费、带 word boundary,但走 Microsoft 云——自己评估隐私与网络可达性)。

三、核心用法(可直接复制)

3.1 触发

在 Claude Code / Codex 里说人话,skill 会自触发:

Make me an explainer video about vector databases.
讲一下向量数据库,做成一条讲解视频

3.2 9 个阶段(README 摘)

  1. Scaffold:从 template 拉 Remotion 项目;
  2. Research(1 个 agent):写带来源 + 数字 + 类比的研究文档,每条带 URL;
  3. Narration & timeline:写脚本 → 跑 TTS → 把 per-word boundary 转成帧级 timeline + 字幕表;
  4. Storyboard:逐镜头一行,含帧范围、beat、视觉、动效、hero 元素、灯光;
  5. Overlays & primitives:title / chapter cards / HUD / pipeline rail + 2-5 个主题图标;
  6. Pilot(1 个 agent):做第一组镜头 + 30 秒 cut 给你看视觉对不对;
  7. Parallel build:剩下几组,每 agent 负责 5-7 shots,写纯函数 Remotion 组件;
  8. Render:Remotion 出 1280×720 H.264;
  9. QC:量化指标 + 视觉审 + 修。

⚠️ 整个流程里你只在 4 个 checkpoint 需要决定:研究框架、旁白脚本、30 秒 pilot、最终交付。其他时间让 agent 并行跑。

3.3 三档长度 → 资源预算(README 表格直引)

长度 中文字数 英文词数 行 / shots Build agents 墙钟 磁盘
2-3 min 700-950 280-420 24-32 4-6 ≈1 h ≈2 GB
3-5 min(参考档) 1200-1500 420-700 40-50 8 ≈2 h ≈2 GB
5-8 min 1800-2400 700-1150 60-80 10-14 ≈2-3 h ≈3 GB

⚠️ 章节数与时长不绑定——你想一章深讲或多个短章都行,进度条均分。

3.4 多语言切换

src/config.tslang 字段切到 zh / en字体、字幕预算、TTS 引擎随之切换

  • 中文:edge-ttszh-CN-YunxiNeural(男声 Yunxi);
  • 英文:kokoro-82mam_liam(男声 Liam);
  • 或自带 TTS / 成品音频。

3.5 看一份完整 paper trail

仓库自带 reference 影片「RAG & Knowledge Bases」两版:

  • 英文版:5′02″、44 行 / 785 词,kokoro-82m am_liam;
  • 中文版:4′54″、44 行 / 1490 字符,dot-field backdrop(bg: 'dots'),走 bring-your-own-TTS(Volcengine TTS 2.0 + forced alignment)。

完整 paper trail:examples/rag/(research → narration → storyboard → shot source → QC reports → delivery notes),渲染帧在 examples/rag/frames/。⚠️ 中文原版是 4′35″、star-field 背景、8 个 build agent 并行 40 分钟、两轮 QC——所以 paper trail 不只是示例,是真实流水线审计证据。

四、典型适用场景

  1. 科普 / 技术讲解视频自动化:写好的研究文档 + 一句话 prompt → 2-3 小时拿到一条 5 分钟讲解视频 + 完整溯源;
  2. 公司内训 / 团队分享:研究文档里的 URL 就是来源;storyboard / 逐镜头源码可以二次修改(不是「神秘黑盒视频」);
  3. 多语种内容并行:中英两版共用一个 storyboard,英文版会按英文旁白时长重排每个镜头——不是简单替换文字;
  4. AI Agent 工作流的可审计演示:因为每帧是代码,没有「随机性像素」,合规与版权边界清晰;
  5. 教育内容本地化改造:海外开源教程 / 论文 summary 翻成中文讲解视频。

五、坑与注意(⚠️ 高密度段)

⚠️ P0 跑前必读

  • edge-tts 必须 pin 7.2.8:README 原话「tracks a Microsoft endpoint and breaks across upgrades」,7.2.0+ 起需要显式请求 word boundaries,脚本里已经处理——升上去就自己负责;
  • Remotion 没有 linux-arm64 headless browser:Pi 5 / Linux ARM 必须 export REMOTION_BROWSER_EXECUTABLE=/usr/bin/chromium,否则渲染起不来;
  • kokoro 在 ARM / Python 3.13 装不上:上文已给两个替代(kokoro-onnx / piper),别死磕原版;
  • edge TTS 走 Microsoft 云:免费但有调用频率限制,敏感内容请走本地引擎(kokoro-onnx / piper / 自带)。

⚠️ P1 性能与资源

  • 磁盘:5-8 min 档要 ≈3 GB free space;并行 build agent 越多内存压力越大(每个 Remotion 浏览器实例 ≥1 GB);
  • 墙钟是「agent 工作时间」,不等于 CPU 时间——8 个 agent 并行 40 分钟需要 8 个能跑的 Remotion 浏览器;
  • 「frame-accurate timeline」依赖 TTS 给出的 per-word boundary;edge / kokoro / kokoro-onnx / piper 都给,自带 TTS 要确认能导出 word boundary

⚠️ P2 内容与版权

  • 零 stock / 零生成视频模型:所有画面都是 React 组件画出来的——这是它和 Sora / Veo 的根本区别,也因此不会生成「随机幻象」,但视觉冲击天花板低于像素生成模型;
  • 不复制别人的视频帧:合规友好,但你自己输入的研究材料要尊重来源,README 的 paper trail 设计就是在强制这件事;
  • license 标注 noncommercial:第三方 X 帖子提到「license is noncommercial」(https://github.com/Vincentwei1021/anything2explainer 仓库本身声明见 LICENSE 文件)——商业用途前自己读 LICENSE,不要照搬 X 上的二手判断。

⚠️ P3 工程边界

  • Windows 未测试,作者在 macOS 开发 + Linux 验证过;
  • 中文版自带「Volcengine TTS 2.0 + forced alignment」作为 bring-your-own-TTS 范例——你换 TTS 时要确认能拿到对齐数据;
  • 字幕 44px 是固定基准,4K 屏幕看可能偏小;想改在 src/config.ts 里改持久图层参数。

六、与同类对比(⚠️ 仅基于公开资料)

维度 anything2explainer Sora / Veo / Runway 传统 Remotion 模板手写 NotebookLM 视频概述
渲染方式 Remotion(代码) 像素生成 Remotion(代码) Google 自动剪辑
版权 0 stock / 0 生成帧 / 0 复制帧 可能含训练数据争议 看作者用啥素材 内置
旁白 + 字幕同步 word-boundary 对齐,帧级 timeline 不适用 自己做 自动(不一定 frame 准)
多 agent 流水线 是(8 个 build agent 并行 + QC)
审计 paper trail 完整(研究 / 旁白 / storyboard / shot source / QC) 自己留
中英并行 共用 storyboard + 重排时间 重新生成 自己做 重新生成
视觉天花板 中(线条 + 紫调,风格统一) 高(像素生成,可写实) 看设计师 中(幻灯片为主)
上手成本 装 skill + 一句话 prompt 写 prompt + 调参 写代码 + 设计 粘贴文本

⚠️ 反方 v2 三段式

  • (1) 机制:它把「视频生成」拆成「研究 → 旁白 → storyboard → 镜头代码 → 渲染 → QC」六段流水线,每段由一个或多个 Claude Code / Codex agent 接力或并行跑——这是「流水线 agent」范式,与「end-to-end 多模态模型」路线不同;优势是可控可审,代价是每个 checkpoint 都可能因为前一档的输入误差而崩。
  • (2) 数据:参考档 44 shots / 5 分钟 / 8 agent / 40 分钟并行 / 两轮 QC——是仓库自报,非独立测评;visual 上限受限于「白线 + 紫调 + 2 种背景」,远低于像素生成模型。
  • (3) 截止日 / 证伪:仓库头部 topics 标签 agent-skills / ai-video / claude-code / claude-code-skill / codex / edge-tts / educational-video / explainer-video / kokoro / motion-graphics / multi-agent / react / remotion / text-to-video / tts / typescript / video-generation——若半年后 topics 仍停留在此且 examples/ 没新增视频档,可视为生态停滞信号。

七、合流与一句话推荐(§七 合流密度)

把三股信息流合到一起:

  • AI Coding Agent 时代:Claude Code / Codex 不再只是「写代码」,开始承担「研究 + 写作 + 编排」全栈工作;skill 形态(~/.claude/skills/ / ~/.codex/skills/)正在变成 Agent 时代的「npm 包」分发单元;
  • 多 Agent 协作:8 个 build agent 并行 + 1 个 research + 1 个 pilot + 1 个 QC = 「软件工程流水线 + 内容生产」直接打通;
  • 「代码画视频」:版权与可解释性是 Sora / Veo 永远回答不好的两个问题,Remotion + 多 Agent 给了另一条路——慢一点、丑一点,但每帧都可追溯

⚠️ 一句话推荐:如果你已经在用 Claude Code 或 Codex,并且需要的不是「酷炫 30 秒 demo」而是「可审计、可改写、中英并行、有溯源的 2-8 分钟讲解视频」——anything2explainer 是 2026 年当前最值得装的 Agent Skill 之一,装一次花 10 分钟,省下几十小时视频制作。商业产品集成前请先读 LICENSE,确认 noncommercial 是否覆盖你的场景;想做 Sora 级写实请直接换视频生成模型,不要硬塞到这个 skill 里。


Spark · 2026-09-13 11:15 CST · W37 · G1 仓库攻略 · verifiability:GitHub README 200 OK + SKILL.md 标题命中 + Remotion / Claude Code / Codex 官网主页命中 · 边界:仅写本文件 guides/vincentwei1021-anything2explainer.md