锁于入口,开于内里:RLVR 收窄解空间的位置

  • 关联论文:2608.29188
  • 作者:Tom
  • 更新:2026-09-05

一句话结论

RLVR(可验证奖励强化学习)在提升 pass@1 的同时,会导致策略的解空间在「入口」处(即首个运算操作符附近)急剧收缩,使得 alternative solution 无法被发起,但一旦发起仍可执行——这是测试时扩展(test-time scaling)收益受损的根源。

解决什么真问题

当前 LLM 后训练广泛使用 RLVR 来提升数学、代码等可验证任务的单样本准确率(pass@1),与此同时,业界也在积极探索 test-time scaling(让模型在推理时做更多计算来提升质量)。然而,这两个方向之间存在一个根本张力:RLVR 优化 pass@1 的过程中,是否无意中损害了 test-time scaling 所依赖的解多样性

具体来说,当模型通过 RLVR 训练后,对于同一个问题,是否还能生成多个不同的正确答案?这种多样性对于 test-time scaling(如 beam search、majority voting)至关重要。这篇论文的核心问题:RLVR 导致的解空间收缩,究竟发生在推理轨迹的哪个位置?是策略「无法访问」某个有效解族,还是「无法启动」某个解但启动后仍能完成?

核心方法

解空间的枚举化——Countdown 任务

研究团队选择 Countdown 任务(给定目标数字,通过加减乘除凑数)作为分析对象,原因在于其解空间可以被穷举枚举:每个解可以唯一归属到一个由「首个操作数+首个运算符」定义的入口族(entrance family)。这使得研究者可以精确追踪策略对每个入口的覆盖率。

两个训练设置

  • PPO on Qwen2.5-3B:标准 PPO 训练
  • GRPO on Qwen2.5-3B-Instruct:DeepSeek 风格的 GRPO(group relative PPO)

关键实验设计:区分「访问」与「执行」

论文设计了一个精妙的实验来诊断问题所在:

给定一个低覆盖率入口族,先只提供该入口的前缀(不包含完整解法),让策略在已有入口前缀的条件下生成后续内容。如果此时完成率大幅上升,说明alternative solutions仍然可执行但无法被发起(问题在「入口选择」,而非「执行能力」)。

关键实验与数据

  1. 解空间收缩幅度:在 PPO 和 GRPO 两种训练设置下,solution coverage 下降高达 67%。即使在所有 checkpoint 上都能解决的问题,覆盖率也会减半。

  2. 定位收缩位置:per-token likelihood shift 在首个运算操作符之前比后续推理阶段高出 11×–16×——说明模型对入口的置信度偏移远大于对推理步骤的偏移。问题集中在入口,而非推理深度。

  3. 入口 vs 执行诊断实验: - 在低覆盖率入口族上,仅提供未选取的入口前缀(entrance prefix)后,完成率从 0.018 提升到 0.212(PPO 下),提升超过 10 倍。 - 这直接证明:alternative solutions 在给定入口前缀后仍可正常执行,只是策略不再主动选取这些入口。

  4. 修复实验: - 表面层面的 prompting(surface prompting)无法恢复多样性。 - Late-layer parameter interpolation(用早期 checkpoint 的 late-layer 参数与训练后 checkpoint 做插值)将 solution coverage 提升 37%,且 pass@1 不降。 - 这说明问题根因在模型表示层面,而非 prompt 层面。

  5. 跨 benchmark 泛化:早期步骤 entropy collapse 在 6 个数学 benchmark7B 和 14B 模型上均出现。但这不是不可避免的——SFT 基线保留了超过 2 倍的 coverage;分阶段 SFT→DPO→RLVR 流水线也能保留早期步骤 entropy。

亮点与局限

亮点

  • 诊断设计精巧:用 Countdown 任务的穷举可枚举性,精确分离了「入口选择」和「执行能力」两个阶段,这在 RLVR 分析中是首次。
  • 反直觉发现:问题不在推理深度,而在入口选择——这意味着 test-time scaling 的失效不是「模型想不出更多步骤」,而是「模型不再尝试另一条路的起点」。
  • 修复方法可行:late-layer interpolation 是一个轻量级干预,不引入额外训练,不损失 pass@1。
  • 现象的普遍性:在 6 个 benchmark、多个模型尺寸上均观察到 early-step entropy collapse,说明这是 RLVR 的共性问题而非 Countdown 特例。

局限

  • 实验主要在 3B 参数模型上完成(Qwen2.5-3B / Qwen2.5-3B-Instruct),更大模型(7B+)仅在泛化实验中涉及,主流尺寸的 7B/14B 结果来自 entropy 间接测量,非直接 coverage 测量。
  • Countdown 任务的可枚举性是特例,难以直接迁移到自然语言任务(如代码生成)上验证——论文acknowledges了这一点,但6个数学benchmark的结果提供了间接证据。
  • Late-layer interpolation 的最优插值点(哪个checkpoint的late layer)需要实验搜索,目前没有理论指导。
  • PPO vs GRPO 的差异未做系统对比——两种训练设置都出现入口收缩,但具体机制是否相同尚不明确。

对工程落地的启发

  1. test-time scaling 组合注意入口多样性:如果使用 RLVR 训练模型,在部署 test-time scaling(voting、search)前,应评估模型是否仍保持足够的解多样性——单纯看 pass@1 可能掩盖了多样性损失。

  2. Late-layer interpolation 作为 post-training 修复手段:对于已训练好的 RLVR 模型,可以通过与早期 SFT checkpoint 做参数插值来恢复多样性,实现「不重训、不损精度」的多样性修复。

  3. 训练 pipeline 设计:如果目标是保留推理多样性,分阶段流水线(SFT → DPO → RLVR)优于直接 RLVR;或者在 RLVR 之前保留一个「SFT-only 副本」作为 diversity backup。

  4. 评估指标补充:现有评估主要关注 pass@k / pass@1,应增加「解空间覆盖率」指标来捕捉多样性维度。

与同方向工作的关系

  • 与 OpenAI o1/o3 的 test-time scaling 路线的关系:o1/o3 等工作展示了测试时计算扩展的有效性,但本文揭示了 RLVR 训练与 test-time scaling 之间存在潜在的负交互——这为理解 o1 系列的训练方式提供了反面视角。
  • 与「process reward」的对比:Process Reward Model (PRM) 关注推理步骤级评估,而本文关注入口选择——两者层次不同,但共同指向「如何在多步推理中保持正确性和多样性」。
  • 与早期的 RL diversity 研究(如 NIL、J覆盖率的变体):传统 RL 中的探索-利用张力在 LLM RLVR 中以新的形式出现(入口选择 vs 执行),本文提供了量化工具。
  • 与 DeepSeek-R1 系列的关系:DeepSeek-R1 使用 GRPO 类训练,其解多样性的变化值得用本文的方法做类似诊断。

适合谁读

  • LLM 后训练工程师:理解 RLVR 对 test-time scaling 的隐性影响,避免只优化 pass@1 而忽略推理多样性。
  • 推理优化 / test-time scaling 研究者:理解为什么 voting / search 类方法的收益在 RLVR 模型上可能不如预期。
  • RL + LLM 交叉方向的研究者:掌握本文的「穷举入口族 + 前缀诊断」方法,可迁移到其他可枚举解空间的推理任务(如代码生成、形式化验证)。
  • 对 LLM reasoning 机制感兴趣的高年级本科生 / 研究生:深入理解 RLVR 如何影响 LLM 的解空间结构。

⚠️ 存疑与未核实项

  • 37% coverage 提升的具体实验条件(插值系数未明确)、PPO/GRPO 差异的机制解释,依据原文 abstract / 主要实验,未调用 PDF 二次核验。
  • 6 个数学 benchmark 的具体名称原文未完整列出,基于摘要陈述。
  • GitHub 仓库 ershiyidian/early-branch-locking 存在性未做 git clone 核验,基于摘要声明引用。