入口卡死,内部还活 · RLVR 收窄解空间的位置 · R2 2026-09-06

arXiv: https://arxiv.org/abs/2608.29188

video-kb 脚本原路径: /shared/video-kb/scripts/tom/2026-09-06_R2_rlvr-locks-at-the-entrance-short-video-script.md

1. 标题与观众

  • 标题:入口卡死,内部还活
  • 目标观众:LLM 后训练工程师 · Test-time scaling 优化工程师 · 推理系统架构师
  • 一句话核心观点:RLVR 让模型不再主动发起别的解法,但解法一旦被给前缀仍能跑通。
  • 备选标题:入口锁死,推理照走

3. 45-90 秒口播稿

你以为 RLVR 训练让 pass@1 涨了 = 模型整体变强?arXiv 2608.29188(上海大学 + 伯明翰 · 8 月 29 日 v1 · Qiancheng Zhou 和 Ruizhe Li)告诉你:其实模型不再「起头」换一条路了。

怎么诊断的?他们用 Countdown 任务(给定目标数字用加减乘除凑数)把解空间穷举拆成「入口族」—— 由「首个操作数 + 首个运算符」定义。PPO 训 Qwen2.5-3B、GRPO 训 Qwen2.5-3B-Instruct 两种设置,solution coverage 都掉到 67%。

数字是这样:per-token likelihood shift 在第一个运算操作符之前,比后续推理阶段高 11×–16×。问题全压在那一步起头。反差来了:只把未选入口的前缀塞给模型,完成率从 0.018 跳到 0.212,涨 10 倍以上。

这说明 alternative 解法还能跑通,只是策略不再主动选那个入口。修复就用 late-layer parameter interpolation—— 早期 SFT checkpoint 的晚期层参数与 RLVR 后 checkpoint 插值,solution coverage 回升 37%,pass@1 不降。

通用性呢?6 个数学 benchmark、7B 和 14B 都看到 early-step entropy collapse。SFT-only baseline 保留 2 倍 coverage;SFT→DPO→RLVR 流水线也保住了早期步骤 entropy。

今天就做一件事:部署 RLVR 模型 + test-time scaling 之前,先评一下入口解空间的覆盖率,别让 voting 和 beam search 在「同一条起头路上」重复投票。

4. 镜头分镜

Scene 1 · 0-8s · 开场冲突卡 · 主标题

  • 时长:8s
  • 屏幕文字:RLVR 让 pass@1 涨,但模型不再尝试别的入口
  • 画面元素:深色背景 · 左侧大号"RLVR" + 绿色箭头"pass@1 ↑" · 右侧红色警告"入口塌" · 底部副标题"≠ 模型整体变强"
  • 运动方式:主标题淡入,反差点闪烁入场

Scene 2 · 8-16s · 入口族定义 + 数字证据卡

  • 时长:8s
  • 屏幕文字:入口族 = 首个操作数 + 首个运算符
  • 画面元素:左侧 Countdown 解空间枚举网格 · 高亮一个入口族节点 · 右侧证据卡"coverage ↓ 67% · likelihood shift 11×–16× · PPO + GRPO" · 底部小字 abstract verbatim
  • 运动方式:网格从中心向外展开,数字依次落字

Scene 3 · 16-24s · 入口前缀诊断反差卡

  • 时长:8s
  • 屏幕文字:0.018 → 0.212 · >10×
  • 画面元素:左侧入口族选 5 个 · 标注"未选入口" · 右侧进度条从 0.018 推到 0.212 · 顶部金句"alternative 解法还能跑,只是策略不再起头"
  • 运动方式:进度条推满,顶部金句延迟 1 秒淡入

Scene 4 · 24-32s · 晚期层插值修复流程图

  • 时长:8s
  • 屏幕文字:晚期层参数插值 · 37% ↑ · pass@1 不降
  • 画面元素:左右双 checkpoint 图标 · 中间插值公式 θ_final = α·θ_SFT + (1-α)·θ_RLVR · 右侧输出卡"coverage +37%" · 底部小字"晚期层判据:最后 25-50% Transformer 层"
  • 运动方式:双 checkpoint 同步滑入,中间公式手写动画,右侧卡淡入

Scene 5 · 32-40s · 跨任务跨尺寸通用性证据卡

  • 时长:8s
  • 屏幕文字:6 题 · 7B · 14B 都塌
  • 画面元素:顶部一排 6 个数学 benchmark 占位方块(名字 abstract 未列)· 底部双柱 = "3B direct" vs "7B/14B entropy 间接" · 右侧小字"不是 Countdown 特例"
  • 运动方式:6 个方块依次填充,双柱对比箭头闪烁

Scene 6 · 40-48s · 限定语风险卡

  • 时长:8s
  • 屏幕文字:5 项 abstract 未明 · 开源度风险
  • 画面元素:黄色警告卡 · 上半 = "6 数学题具体名称 / 插值点搜索算法 / 3B vs 7B 曲线 / PPO vs GRPO 机制对比 / SFT→DPO→RLVR 各阶段数据分配 — abstract 未明" · 下半 = "GitHub 仓库不发布权重/rollout/credentials/result tables · 复现需外部 TinyZero/veRL"
  • 运动方式:警告卡淡入,上半五行小字依次出现,下半单行延迟入场

Scene 7 · 48-56s · 行动清单收尾

  • 时长:8s
  • 屏幕文字:先评入口覆盖率 · 再上 test-time scaling
  • 画面元素:深色背景金句卡 · 大号字 verbatim "部署 RLVR 模型 + test-time scaling 之前,先评入口解空间覆盖率" · 右侧小字"别让 voting 在同一条起头路上重复投票"
  • 运动方式:金句推入,小字延迟 1 秒出现,结尾留白