Tom R2 短视频脚本镜像 · 2026-08-29 · TTPO · arXiv 2608.27448
- 日期与轮次:2026-08-29 (Asia/Shanghai) · R2(中午档 · 13:25 CST)
- arXiv 链接:https://arxiv.org/abs/2608.27448
- video-kb 脚本原路径:
/shared/video-kb/scripts/tom/2026-08-29_R2_ttpo-no-label-test-time-policy-short-video-script.md
1. 标题与观众
- 标题:无标签也能跑后训练 · 一致蒸馏 / 不一致 RL
- 目标观众:LLM 后训练研究者(数学推理 / 代码生成 RLHF 团队)· LLM 平台 / 推理服务工程师· RLHF / RLAIF 实践者
- 一句话核心观点:数学推理后训练可以完全不要 ground-truth 标签——同一 prompt 采样 N 条 rollout,一致走蒸馏、不一致走 RL 惩罚,无需任何答案。
3. 45-90 秒口播稿
[scene 1 · 5s · 冲突]
你以为数学推理后训练,
一定需要 ground-truth 答案?
[scene 2 · 12s · 机制]
TTPO 完全不用任何标签——
同一 prompt 采样 N 条 rollout,
多数票得伪标签,然后分组路由。
[scene 3 · 14s · 流程]
一致的 rollout 走 OPSD 蒸馏,
强化已学到的;
不一致的 rollout 走 Grouped RL 惩罚。
[scene 4 · 14s · 数字卡]
Qwen3-1.7B 数学推理
38.0% → 45.2%,
无思考模式 +25.2% 到 +36.4%。
[scene 5 · 12s · 对齐]
五个竞赛级 benchmark 上,
TTPO 与有标签 OPSD 对齐度 matches,
跨任务泛化报告 strong。
[scene 6 · 12s · 闭环]
关键观察:不一致 ≈ 错,
不管多数票本身对不对——
模型越好,多数票越准,闭环越稳。
[scene 7 · 14s · 行动]
行动:夜间自训练 pipeline 模板,
采样 N 条 → 多数票 → 不对称更新 → 新 ckpt。
监控 agree rate 骤降 20% 立即停训。
GitHub: ZJU-REAL/TTPO。
4. 镜头分镜
| shot | 时长 | 屏幕文字(≤ 18 字) | 画面元素 | 运动方式 |
|---|---|---|---|---|
| 1 | 5s | 数学推理后训练 一定需要答案吗? |
标题卡(深蓝底 + 白色衬线字体)+ 问号图标 | 文字逐字淡入 · 问号弹跳一次 |
| 2 | 12s | 完全不用标签 采样 → 多数票 → 分组 |
流程图(prompt 节点 + N 条 rollout 分叉 + 多数票节点) | 左到右滚动 · rollout 线条依次出现 |
| 3 | 14s | 一致 → OPSD 蒸馏 不一致 → Grouped RL |
双分支图(绿 vs 红)+ token 级筛子图标(橙) | 绿/红分支从中间展开 · 筛子向下过滤 |
| 4 | 14s | 38.0% → 45.2% 无思考 +25.2 ~ +36.4% |
证据卡(数字大字 + 折线箭头)+ 5 benchmark 名录滚动条 | 数字弹出 · 折线箭头左到右 · 名录横向滚动 |
| 5 | 12s | matches 有标签 OPSD 跨任务 strong |
对齐卡(等号图标 + "matches" 字面 + 5 benchmark 名录) | 等号居中放大 · 名录依次高亮 |
| 6 | 12s | 不一致 ≈ 错 闭环:模型 → 票 → 蒸馏 |
闭环回路图(模型 → 采样 → 多数票 → 不对称更新 → 模型,紫色反馈环) | 顺时针转动 · 反馈环反向高亮 |
| 7 | 14s | 夜间自训练模板 监控 agree rate 骤降 20% |
行动清单(代码块 + GitHub URL + 停训阈值) | 代码块逐行出现 · URL 高亮 · 阈值红框闪烁 |