日期与轮次:2026-09-30 · R2 中午棒 arXiv 链接:https://arxiv.org/abs/2609.32577 video-kb 脚本原路径:/shared/video-kb/scripts/tom/2026-09-30_R2_gagar-grpo-quality-ranking_short-video-script.md

1. 标题与观众

  • 标题:GRPO 别把测试通过当铁板(14 chars · 命中 candidates §1 候选 1 字面 verbatim · 工程劝退式 + 反直觉核心直击「GRPO 默认二元奖励 = 通过/失败铁板一块」)
  • 目标观众:AI 工程师(LLM RL 训练 / GRPO / 代码 Agent RL 方向)+ LLM RL 训练研究员(GRPO 二元奖励盲区 + credit assignment 信号)+ 代码 Agent 团队 Lead + RLHF / RLAIF 工程师 + 关心 RL 训练稳定性 + reward shaping 的技术产品经理
  • 一句话核心观点:用 SFT 评分员把 GRPO 的「测试通过」铁板敲碎,按质量重新分配优势。

3. 45-90 秒口播稿

[段 1 · 20 秒冲突] 代码 Agent 的 RL 几乎都用可执行测试当奖励源,再叠 GRPO 做组内相对策略优化。但通过测试 ≠ 实现质量好——一个 50 行精准命中需求,一个塞了 200 行无关改动还过了测试,两者拿到的策略梯度完全一样。

[段 2 · 28 秒机制] GAGAR 把这块铁板敲碎:先 dynamic sampling,只保留同时含通过与失败轨迹的 rollout 组;再把所有轨迹放进共享工作空间,让 SFT 训练的智能评分员联合检视、对通过子集做相对排序;最后 sum-preserving 优势再分配——低排名 downweight,按比例 rescale,恢复优势总和,让 GRPO 的 baseline 与方差估计仍稳定。

[段 3 · 13 秒结果] 论文在小米 MiMo 工业规模验证——Flash 310B 总参数做受控代码实验,Pro 1.02T 做大规模混合任务 RL,同时拿到代码性能提升、轨迹长度增长抑制、训练稳定性提升三件套。

字幕层叠加限定语:abstract 未给出具体百分点;GAGAR 仓库 abstract 未明确;公开基准覆盖 abstract 未明确;跨模型迁移性 abstract 未明确;arXiv v1 release_age > 48h 越界。

4. 镜头分镜

  1. 镜头 1 · 标题卡 · 0-8s - 时长:8s - 屏幕文字:GRPO 别把测试通过当铁板(≤18 字) - 画面元素:黑底 + 主标题字面 + 副标题「GAGAR · 代码 Agent RL」 - 运动方式:标题卡从下往上推入 · 副标题 1.5s 后淡入

  2. 镜头 2 · 流程图卡 · 8-20s - 时长:12s - 屏幕文字:测试通过 = 1,失败 = 0(≤18 字) - 画面元素:流程图卡 = 代码 Agent RL 训练循环(环境 → 测试通过 → GRPO 二元奖励 = 通过/失败)· 红字「同优势」高亮组内通过轨迹 - 运动方式:流程图从左向右展开 · 二元奖励格按节奏闪烁 · 末 2s 镜头拉到「同优势」字面

  3. 镜头 3 · 左右对比卡 · 20-35s - 时长:15s - 屏幕文字:50 行精准 vs 200 行无关改动 = 同梯度(≤18 字) - 画面元素:左 = 50 行精准实现(绿色勾 + 短代码块)· 右 = 200 行无关改动(黄色勾 + 长代码块)· 中央箭头「= 同优势」 - 运动方式:左右卡同步推入 · 中央箭头横向连接 · 末 2s 镜头推到「= 同梯度」字面

  4. 镜头 4 · 三栏对照卡 · 35-50s - 时长:15s - 屏幕文字:GAGAR 三件套 · 动态采样 · 评分员 · 再分配(≤18 字) - 画面元素:三栏对照卡 = ① dynamic sampling ② 共享工作空间 + SFT 评分员 ③ sum-preserving 再分配 · 每栏配 1 个 micro 图标 - 运动方式:三栏依次推入 · 每栏 5s · 末 2s 三栏同时高亮「sum-preserving」字面

  5. 镜头 5 · 工业规模卡 · 50-70s - 时长:20s - 屏幕文字:MiMo Flash 310B · Pro 1.02T · 性能 + 长度 + 稳定(≤18 字) - 画面元素:模型规模标签 MiMo-V2.6-Flash 310B 总参数 + MiMo-V2.6-Pro 1.02T 总参数 · 三件套收益横排(代码性能 / 轨迹长度抑制 / 训练稳定)· 三件套三个 ✓ - 运动方式:模型规模标签从左侧推入 · 三件套收益横排从右侧推入 · 末 3s 三个 ✓ 同时点亮

  6. 镜头 6 · 风险卡 · 70-85s - 时长:15s - 屏幕文字:abstract 未给具体百分点 · 仓库未明确 · 公开基准未明(≤18 字) - 画面元素:风险卡 = 5 条限定语字幕叠加 · 红字警示 - 运动方式:风险卡从底部推入 · 5 条限定语逐条浮现 · 每条 2-3s

  7. 镜头 7 · 收尾卡 · 85-90s - 时长:5s - 屏幕文字:GRPO 别把测试通过当铁板(≤18 字) - 画面元素:主标题字幕 verbatim · 底部小字「GAGAR · arXiv 2609.32577」 - 运动方式:主标题静止显示 · 底部小字淡入 · 末 0.5s 整体渐黑