Tom 视频脚本镜像 · arXiv 2607.21653 · Molt
- 日期与轮次:2026-07-27 R3
- arxiv 链接:https://arxiv.org/abs/2607.21653
- video-kb 脚本原路径:
/shared/video-kb/scripts/tom/2026-07-27_R3_short-video-script.md
本镜像为 best-effort 副本,仅含视频生产所需的 3 节(标题与观众 / 口播稿 / 镜头分镜)。完整脚本含 §0/§2/§5/§6/§7/§8/§9 等详见 video-kb 脚本原路径。
1. 标题与观众
标题:Molt · 一份代码 hold 住 Agentic RL
- 目标观众:AI 工程师 / 训练基础设施研究员 / Agent 框架研究员
- 一句话核心观点:Molt 用紧凑 codebase 把 Agentic RL 训练代码变成 AI 助手能完整推理的事。
3. 45-90 秒口播稿
Agentic RL 研究者每次想换 estimator,都得在 trainer、distributed backend、rollout glue 三层胶水里穿针引线。Molt 把 codebase 压到 ~9.2K LOC,让 AI Coding Assistant 能完整读取推理。Ray 加 vLLM 兜底 rollout,单一主循环同时跑 multimodal 和 MoE,论文 verbatim 强调 consistent in tokens, policy versions, and model semantics。在 matched fully async 协议下,与 Megatron SOTA 堆栈统计持平。要带走的一行:把 codebase hold 住,再等 Megatron 对比数据。
4. 镜头分镜
- scene-1(hero 标题卡 · 0-8 秒):屏幕文字
Molt 一份代码+hold 住 RL(分两行显示,每行 ≤ 18 字);画面元素:左下角 NVIDIA 调色板 / 右上角 Molt 仓库占位框;运动方式:淡入 + 缩放至 1080p 居中。 - scene-2(痛点卡 · 8-16 秒):屏幕文字
三大痛点;画面元素:trainer / distributed / rollout 三层立方体堆叠成金字塔;运动方式:摄像机围绕金字塔慢摇。 - scene-3(机制三栏 · 16-32 秒):屏幕文字
Ray + vLLM/multimodal + MoE/一致 token model;画面元素:三栏卡片,每栏顶部一个栈名 + 中段抽象几何;运动方式:自上而下逐栏点亮。 - scene-4(证据大数字 · 32-40 秒):屏幕文字
~9.2K LOC+639★;画面元素:左 LOC 计数器滚动 + 右 star 计数动画;运动方式:数字自右向左飞入。 - scene-5(风险卡三件套双行 · 40-52 秒):屏幕文字主行
主分类三标签+ 副行cs.LG+cs.CL+cs.DC;主行代码已开源+ 副行description=null;主行harness 未明+ 副行字幕层兜底;画面元素:三张双行卡片垂直堆叠;运动方式:逐张推入。 - scene-6(行动卡 · 52-62 秒):屏幕文字
把代码 hold 住+等对比数据(分两行显示,每行 ≤ 18 字);画面元素:键盘侧拍 + Molt 仓库图标悬浮;运动方式:模糊到清晰的镜头切换。 - scene-7(落版卡 · 62-72 秒):屏幕文字
框架可审计层+ 旋转条 14 个往期议题视角(左滑快进);画面元素:中心落脚框架可审计层高亮 + 外圈 14 层议题旋转条;运动方式:旋转条快进 + 收尾慢推。