Tom 视频脚本镜像 · arXiv 2607.21653 · Molt

  • 日期与轮次:2026-07-27 R3
  • arxiv 链接:https://arxiv.org/abs/2607.21653
  • video-kb 脚本原路径/shared/video-kb/scripts/tom/2026-07-27_R3_short-video-script.md

本镜像为 best-effort 副本,仅含视频生产所需的 3 节(标题与观众 / 口播稿 / 镜头分镜)。完整脚本含 §0/§2/§5/§6/§7/§8/§9 等详见 video-kb 脚本原路径。

1. 标题与观众

标题:Molt · 一份代码 hold 住 Agentic RL

  • 目标观众:AI 工程师 / 训练基础设施研究员 / Agent 框架研究员
  • 一句话核心观点:Molt 用紧凑 codebase 把 Agentic RL 训练代码变成 AI 助手能完整推理的事。

3. 45-90 秒口播稿

Agentic RL 研究者每次想换 estimator,都得在 trainer、distributed backend、rollout glue 三层胶水里穿针引线。Molt 把 codebase 压到 ~9.2K LOC,让 AI Coding Assistant 能完整读取推理。Ray 加 vLLM 兜底 rollout,单一主循环同时跑 multimodal 和 MoE,论文 verbatim 强调 consistent in tokens, policy versions, and model semantics。在 matched fully async 协议下,与 Megatron SOTA 堆栈统计持平。要带走的一行:把 codebase hold 住,再等 Megatron 对比数据。

4. 镜头分镜

  • scene-1(hero 标题卡 · 0-8 秒):屏幕文字 Molt 一份代码 + hold 住 RL(分两行显示,每行 ≤ 18 字);画面元素:左下角 NVIDIA 调色板 / 右上角 Molt 仓库占位框;运动方式:淡入 + 缩放至 1080p 居中。
  • scene-2(痛点卡 · 8-16 秒):屏幕文字 三大痛点;画面元素:trainer / distributed / rollout 三层立方体堆叠成金字塔;运动方式:摄像机围绕金字塔慢摇。
  • scene-3(机制三栏 · 16-32 秒):屏幕文字 Ray + vLLM / multimodal + MoE / 一致 token model;画面元素:三栏卡片,每栏顶部一个栈名 + 中段抽象几何;运动方式:自上而下逐栏点亮。
  • scene-4(证据大数字 · 32-40 秒):屏幕文字 ~9.2K LOC + 639★;画面元素:左 LOC 计数器滚动 + 右 star 计数动画;运动方式:数字自右向左飞入。
  • scene-5(风险卡三件套双行 · 40-52 秒):屏幕文字主行 主分类三标签 + 副行 cs.LG+cs.CL+cs.DC;主行 代码已开源 + 副行 description=null;主行 harness 未明 + 副行 字幕层兜底;画面元素:三张双行卡片垂直堆叠;运动方式:逐张推入。
  • scene-6(行动卡 · 52-62 秒):屏幕文字 把代码 hold 住 + 等对比数据(分两行显示,每行 ≤ 18 字);画面元素:键盘侧拍 + Molt 仓库图标悬浮;运动方式:模糊到清晰的镜头切换。
  • scene-7(落版卡 · 62-72 秒):屏幕文字 框架可审计层 + 旋转条 14 个往期议题视角(左滑快进);画面元素:中心落脚框架可审计层高亮 + 外圈 14 层议题旋转条;运动方式:旋转条快进 + 收尾慢推。