RISE · arXiv 2609.05295 · 短视频脚本镜像

  • date: 2026-09-08
  • round: R2
  • arxiv: https://arxiv.org/abs/2609.05295
  • video-kb 脚本原路径: /shared/video-kb/scripts/tom/2026-09-08_R2_rise-opd-self-teacher-short-video-script.md

1. 标题与观众

  • 标题:RLVR 外推自己当老师
  • 目标观众:AI 工程师 / LLM 后训练平台工程师 / RLHF-RLVR 平台 owner
  • 一句话核心观点:RLVR 告诉方向,OPD 逐 token 精修,RISE 把学生自己「将要收敛到的未来 policy」外推成教师。

3. 45-90 秒口播稿

RLVR 告诉整条回复对不对,但哪个 token 该改没人说。OPD 给逐 token 信号,卡在「教师从哪来」。RISE 把这两件事焊死。

公式一行:教师 = 当前 policy + β 倍最近更新位移,β > 1。学生就是老师,不需外部模型、不需 privileged context,只用训练 checkpoint。

RLVR 用 outcome reward 锚方向,OPD 用外推的未来 policy 做逐 token 蒸馏。每轮刷新 = 递归自改进,四类任务超纯 RLVR。

要叠限定语:abstract 只给方向性结论,β 起步 1.5~2.0 是经验值,verifier 漏洞被 β>1 放大。

动手:保留 checkpoint、加 logits loss 头、β 从 1.5 sweep。

4. 镜头分镜

  • Scene 1(0-8s · 时长 8s):标题卡。屏幕文字「RLVR 外推自己当老师」12 chars verbatim。画面元素:深色背景 + 装饰球体 + H1。运动方式:球体缓慢旋转,H1 从下方 30px 滑入。
  • Scene 2(8-22s · 时长 14s):冲突陈述。屏幕文字「稀疏信号 · 逐 token 缺失」。画面元素:左侧 RLVR 流程图(单一奖励箭头)vs 右侧 OPD 流程图(教师分布箭头),中间大叉。运动方式:左右两图同时淡入,叉号 scale 0→1。
  • Scene 3(22-38s · 时长 16s):机制公式。屏幕文字「φ(π_future) = φ(π_θ) + β·(φ(π_θ') − φ(π_θ)),β>1」。画面元素:三维向量空间,θ / θ' / future 三点连成箭头,β 倍距离用红色高亮。运动方式:相机沿箭头方向推进,β 标签脉冲闪烁。
  • Scene 4(38-54s · 时长 16s):RLVR × OPD 互补闭环。屏幕文字「方向锚定 + 逐 token 精修」。画面元素:循环图(RLVR → 外推 → OPD → 回到 RLVR),三层 bullets。运动方式:循环箭头顺时针旋转 360°。
  • Scene 5(54-68s · 时长 14s):收益与限定语并列。屏幕文字「零外部开销 + β 未给扫描 · verifier 敏感」。画面元素:左侧三行绿字收益,右侧三行黄字限定语。运动方式:左右两栏从中心对开。
  • Scene 6(68-80s · 时长 12s):风险卡。屏幕文字「GitHub 仓库未明列 · abstract 偏定性」。画面元素:风险清单 8 件套 W-RISE-R2-Caution 1-6,前 6 条以 bullet 形式展示。运动方式:bubbles 从下方依次浮起。
  • Scene 7(80-90s · 时长 10s):行动清单。屏幕文字「保留 checkpoint · 加 logits loss 头 · β=1.5 起步」。画面元素:H1 + 三行 bullets + 装饰球体收尾。运动方式:全部元素 scale 1.05→1 收束。