Tom R2 短视频脚本镜像 · 2026-08-29 · TTPO · arXiv 2608.27448

  • 日期与轮次:2026-08-29 (Asia/Shanghai) · R2(中午档 · 13:25 CST)
  • arXiv 链接:https://arxiv.org/abs/2608.27448
  • video-kb 脚本原路径:/shared/video-kb/scripts/tom/2026-08-29_R2_ttpo-no-label-test-time-policy-short-video-script.md

1. 标题与观众

  • 标题:无标签也能跑后训练 · 一致蒸馏 / 不一致 RL
  • 目标观众:LLM 后训练研究者(数学推理 / 代码生成 RLHF 团队)· LLM 平台 / 推理服务工程师· RLHF / RLAIF 实践者
  • 一句话核心观点:数学推理后训练可以完全不要 ground-truth 标签——同一 prompt 采样 N 条 rollout,一致走蒸馏、不一致走 RL 惩罚,无需任何答案。

3. 45-90 秒口播稿

[scene 1 · 5s · 冲突]
你以为数学推理后训练,
一定需要 ground-truth 答案?

[scene 2 · 12s · 机制]
TTPO 完全不用任何标签——
同一 prompt 采样 N 条 rollout,
多数票得伪标签,然后分组路由。

[scene 3 · 14s · 流程]
一致的 rollout 走 OPSD 蒸馏,
强化已学到的;
不一致的 rollout 走 Grouped RL 惩罚。

[scene 4 · 14s · 数字卡]
Qwen3-1.7B 数学推理
38.0% → 45.2%,
无思考模式 +25.2% 到 +36.4%。

[scene 5 · 12s · 对齐]
五个竞赛级 benchmark 上,
TTPO 与有标签 OPSD 对齐度 matches,
跨任务泛化报告 strong。

[scene 6 · 12s · 闭环]
关键观察:不一致 ≈ 错,
不管多数票本身对不对——
模型越好,多数票越准,闭环越稳。

[scene 7 · 14s · 行动]
行动:夜间自训练 pipeline 模板,
采样 N 条 → 多数票 → 不对称更新 → 新 ckpt。
监控 agree rate 骤降 20% 立即停训。
GitHub: ZJU-REAL/TTPO。

4. 镜头分镜

shot 时长 屏幕文字(≤ 18 字) 画面元素 运动方式
1 5s 数学推理后训练
一定需要答案吗?
标题卡(深蓝底 + 白色衬线字体)+ 问号图标 文字逐字淡入 · 问号弹跳一次
2 12s 完全不用标签
采样 → 多数票 → 分组
流程图(prompt 节点 + N 条 rollout 分叉 + 多数票节点) 左到右滚动 · rollout 线条依次出现
3 14s 一致 → OPSD 蒸馏
不一致 → Grouped RL
双分支图(绿 vs 红)+ token 级筛子图标(橙) 绿/红分支从中间展开 · 筛子向下过滤
4 14s 38.0% → 45.2%
无思考 +25.2 ~ +36.4%
证据卡(数字大字 + 折线箭头)+ 5 benchmark 名录滚动条 数字弹出 · 折线箭头左到右 · 名录横向滚动
5 12s matches 有标签 OPSD
跨任务 strong
对齐卡(等号图标 + "matches" 字面 + 5 benchmark 名录) 等号居中放大 · 名录依次高亮
6 12s 不一致 ≈ 错
闭环:模型 → 票 → 蒸馏
闭环回路图(模型 → 采样 → 多数票 → 不对称更新 → 模型,紫色反馈环) 顺时针转动 · 反馈环反向高亮
7 14s 夜间自训练模板
监控 agree rate 骤降 20%
行动清单(代码块 + GitHub URL + 停训阈值) 代码块逐行出现 · URL 高亮 · 阈值红框闪烁