date_round: 2026-07-15 R3 arxiv_id: "2607.05394" arxiv_url: "https://arxiv.org/abs/2607.05394" video_kb_origin: "/shared/video-kb/scripts/tom/2026-07-15_R3_direct-opd-weak-to-strong-distillation-short-video-script.md"
镜像自 video-kb · 仅包含 §1 / §3 / §4 三节 · 用于 research-kb 索引
1. 标题与观众
标题:Direct-OPD · 用 Δ = log π^RL − log π^ref 把弱教师的 RL 经验蒸馏到强学生 · 跨规模可复用 · AIME 2024 +10pp · 4h × 8×A100
目标观众:LLM Post-Training 工程师 / RL on LLMs 研究者 / AI Infra + 模型版本管理团队(关心 RL 经验复用 + 跨规模蒸馏 + 弱教师 → 强学生 + GRPO 替代方案 + sequential composition + checkpoint pair 可分发 artifact)
一句话核心观点:搬教师的"policy shift"而不是最终策略,把 Δ 作为稠密隐式奖励跨规模复用 RL 经验。
脚本作者基于 arXiv:2607.05394 abstract + §3 + §4 + §5 verbatim 转述 · 非作者声明
3. 45-90 秒口播稿
(开头 5 秒 · 冲突 / 问题意识)
每次模型换代,post-training 都要在新模型上重新跑一遍稀疏奖励 RL——rollout 成本爆炸,模型越大越跑不动。
(机制 · Δ 公式)
Direct-OPD 不搬教师的最终策略,而是搬教师的"policy shift"。也就是把 RL 前后的对数概率差,作为稠密、连续、低方差的隐式奖励,直接作用在强学生自己的 on-policy 状态上。
(证据 · 硬指标)
论文报告:1.7B 起步,8 张 A100,4 个小时,把 AIME 2024 从 48.3% 推到 58.3%,多 10 个点。
(边界 · 跨规模与组合)
更关键的是,1.7B 的 RL 经验可以驱动 7B+ 的学生继续往上推,多轮 policy shift 还能串起来,论文叫 sequential composition。
(结尾 · 可执行动作)
今天能带走的:你已经有 RL checkpoint 了,就把它和参考策略一起发出来,下游可以直接用 Direct-OPD 套到更大的模型上,不必从头再跑 GRPO。
脚本作者转述 / 非作者 verbatim 声明 · 类比:Direct-OPD 像把教师的"学习轨迹"而不是"最终答案"传给学生 · 适用边界(W9):Direct-OPD 适用于「已有 RL checkpoint 复用」场景 · 不适用「从零 RL」场景 · 避免读者误判(PR8 + PR9):Direct-OPD 与 DPO(偏好对)/ SFT(教师最终参数)/ GRPO(直接 RL 目标)同方向但不构成替代 · 类比:不取代 GRPO
4. 镜头分镜
镜头 1 · 0-8s · Hero Title
- 屏幕文字:
Direct-OPD · 搬 policy shift(safeText ≤ 18 字) - 画面元素:深色背景 + 大字标题 + 副标题 "arXiv:2607.05394 · 清华-字节 SIA"
- 运动方式:文字快速打字机效果出现 · 副标题淡入
镜头 2 · 8-16s · 流程图(SFT vs DPO vs Direct-OPD)
- 屏幕文字:
SFT 搬 π_RL | DPO 搬偏好对 | Direct-OPD 搬 Δ - 画面元素:三列并排对比卡 · 中间 Direct-OPD 高亮金色边框
- 运动方式:从左到右依次点亮 · 中间卡轻微脉冲
镜头 3 · 16-24s · 核心公式
- 屏幕文字:
Δ_θ(a|s) = log π^RL − log π^ref - 画面元素:白色 LaTeX 公式 + 下方公式图示化箭头(RL 后 → log 概率差)
- 运动方式:公式从模糊到清晰 · 箭头随口播同步绘制
镜头 4 · 24-32s · 硬指标证据卡
- 屏幕文字:
AIME 2024 · 48.3 → 58.3 (+10pp · 论文自报) - 画面元素:柱状图(48.3 → 58.3 上升)+ 小字标注 "4h × 8×A100 · Qwen3-1.7B"
- 运动方式:柱状图从 48.3 增长到 58.3 · 顶部数字同步跳动
镜头 5 · 32-40s · 4 关键性质卡片
- 屏幕文字:
稠密连续低方差 | 跨规模可迁移 | sequential composition | 避天花板 - 画面元素:2×2 网格卡片 · 每张图标 + 一句话 · 右上角标注 "Δ = log π^RL − π^ref"
- 运动方式:四张卡依次翻转出现 · 最后一卡高亮
镜头 6 · 40-48s · 边界风险卡(W9)
- 屏幕文字:
不取代 GRPO · 适用 已有 RL checkpoint 复用 - 画面元素:红色边框风险卡 · 三行对比列表 · 底部小字 "见 W9 边界"
- 运动方式:风险卡从下向上滑入 · 三行依次出现
镜头 7 · 48-56s · 行动清单
- 屏幕文字:
1. 发 (π_ref, π_RL) pair | 2. 下游 Direct-OPD 蒸馏 | 3. 跳过新一轮 RL rollout - 画面元素:绿色行动清单 · 三步编号 · 末尾 CTA 按钮 "把 RL 经验跨档复用"
- 运动方式:三步依次勾选 · CTA 按钮呼吸闪烁