date_round: 2026-07-20 R2 arxiv_url: https://arxiv.org/abs/2607.13399 video_kb_script_origin: /shared/video-kb/scripts/tom/2026-07-20_R2_opd-demystify-roles-pathologies-short-video-script.md

1. 标题与观众

标题:OPD 病态与调控

目标观众:RL on LLMs 研究者 / LLM Post-Training 工程师 / 模型蒸馏团队负责人

一句话核心观点:把 OPD 拆成角色·病态·调控三层,先诊断再调参,信号质量胜过教师规模。

3. 45-90 秒口播稿

团队已经在用 OPD 蒸馏小教师到大学生,以为教师越大越好——可 7B 教师有时反超 70B,蒸馏反而把学生搞坏。

论文 arXiv 2607.13399 v1 把 OPD 拆成三层:三类 roles(探索催化剂 / 行为矫正器 / 价值蒸馏器);五类 pathologies(reward hacking、模式塌缩、off-policy 漂移、价值过估计、探索锁死);三条 regulations(信号质量门控、学生容量匹配、探索熵下限)。结论 verbatim:调控良好的信号质量,胜过单纯的教师模型规模。

今天能带走的:先用 5 类病态清单诊断症状,再选 3 条调控规则中的一条去修,别先换更大的教师。

4. 镜头分镜

镜头 1 · 0-8s · Hero Title

  • 时长:8 秒
  • 屏幕文字:OPD 病态与调控
  • 画面元素:深色背景 + 橙色 hero 标题卡 + 副标题「arXiv 2607.13399 v1 · 反方审稿层」
  • 运动方式:hero 标题打字机效果出现 · 副标题淡入

镜头 2 · 8-18s · 常识崩塌卡(真问题)

  • 时长:10 秒
  • 屏幕文字:教师越大越好? 7B 反超 70B
  • 画面元素:左侧「教师 70B → 失败」红叉卡 · 右侧「教师 7B → 反而成功」绿勾卡 · 中央橙色 broken-arrow
  • 运动方式:左右两栏从两侧滑入 · broken-arrow 弹跳放大

镜头 3 · 18-30s · 三类角色分支图

  • 时长:12 秒
  • 屏幕文字:探索催化剂 | 行为矫正器 | 价值蒸馏器
  • 画面元素:三个分支卡片并排 + 中央「OPD」方框 + 三向箭头
  • 运动方式:三个分支依次从中央放射出现 · 箭头同步绘制

镜头 4 · 30-44s · 五类病态卡(警示)

  • 时长:14 秒
  • 屏幕文字:reward hacking · 模式塌缩 · off-policy 漂移 · 价值过估计 · 探索锁死
  • 画面元素:2+3 网格五张警示卡 · 每张左侧警示三角图标
  • 运动方式:五张卡依次下落 · 警示图标同步闪两次

镜头 5 · 44-58s · 三条调控规则卡 + 关键 trick 限定语

  • 时长:14 秒
  • 屏幕文字:信号质量门控 | 学生容量匹配 | 探索熵下限
  • 画面元素:三条横排调控卡 · 关键 trick 大字「well-regulated signal quality > teacher scale」+ 副行小字「论文 abstract verbatim · 解释稿二次解读 · 非落地承诺」
  • 运动方式:三条卡依次向右滑入 · 关键 trick 框呼吸闪烁

镜头 6 · 58-72s · W 风险卡三件套(双行排版)

  • 时长:14 秒
  • 屏幕文字:W11 公开状态: v1 PDF 已发 · 未见 v2(主行)+「未进同行评议 · 距今 9 天」(副行) / W12 反方审稿: 0 第三方复现(主行)+「0 反方审稿 · W14 同源」(副行) / W4 数字外推: abstract 未给阈值(主行)+「不可外推为学界共识」(副行)
  • 画面元素:三张风险卡竖排 · 每张左侧警示图标 + 双行小字
  • 运动方式:三张卡依次下落 · 双行小字同步淡入

镜头 7 · 72-80s · 三问行动清单

  • 时长:8 秒
  • 屏幕文字:1. 用 5 类病态诊断症状 / 2. 选 3 条调控规则中的一条去修 / 3. 别先换更大的教师
  • 画面元素:绿色三步编号清单 · 末尾 CTA「先诊断再调参」
  • 运动方式:三步依次勾选 · CTA 按钮呼吸闪烁