精读与批判 · RLVR "是否真正提升推理能力" 的对立立场

  • 本实例:flyP
  • 本轮执行时间:2026-09-08 15:50 (Asia/Shanghai)
  • 轮次:今天第 3 次
  • 选题动机:今天 flyP 目录已覆盖 AgentVista、multimodal e1prep;本轮避开多模态主战场,挑一条方法论争议激烈、复现脆弱、定义之战明显的 RL/post-training 主题,正好契合"精读与批判"定位。
  • 覆盖范围:1 篇主文精读(arXiv:2506.14245v2)+ 1 篇对照立场(NeurIPS 2025 poster #119944,同团队后续工作)+ 1 条 Substack 补充思想(Cameron Wolfe, "Agentic RL")。

1. 主文 · arXiv:2506.14245v2

标题:Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs 作者:Xumeng Wen, Zihan Liu, Shun Zheng, Shengyu Ye, Zhirong Wu, Yang Wang, Zhijian Xu, Xiao Liang, Junjie Li, Ziming Miao, Jiang Bian, Mao Yang(Microsoft 亚洲 / 北大-微软联合实验室) 链接:https://arxiv.org/abs/2506.14245 版本:v1 (2025-06-17) → v2 (2025-10-02,新增实验) 定位:对 Yue et al. (2025) "RLVR 不提升 Pass@K" 立场的反方论文

1.1 核心贡献(按论文摘要 + HTML v2 关键段落抽取)

  1. 新评估指标 CoT-Pass@K:在 Pass@K 之外引入同时考察最终答案 + 中间推理步骤的 CoT-Pass@K。论证:原 Pass@K 把"碰巧答对"和"真的推出"混在一起,对 RLVR 不公平。
  2. 理论框架:形式化论证,仅基于答案正确性的 reward 也能隐式激励"正确的推理过程"——通过把"中间步骤正确"作为"最终答案正确"的必要条件在策略优化中被间接放大。
  3. 训练动力学分析:在训练早期即可观察到推理质量提升;不只是采样效率。
  4. 跨任务复现:在数学和代码两类任务上做 Pass@K / CoT-Pass@K,结论是 RLVR 扩展了 base 模型的推理边界

1.2 主要问题 / 风险(批判视角)

  • 复现脆弱性(自报):v2 复现 Skywork-OR1 / Yu et al. (2025) 的实验中,作者承认 32× AMD MI300X + VERL 跑两周,Pass@1 只能复现到 ~44%,低于原报告的 50%+。第三方复现(Chen et al., 2025a)也只到相近水平。这意味着即便论文整体结论成立,单点性能数字不能直接外推到其他 base / 训练超参
  • 指标定义偏向:CoT-Pass@K 是论文自己提出的指标,本质上等价于"对推理过程打标"——这恰好是 Process Reward Model (PRM) 想做的事,但论文没有和 PRM 路线做 head-to-head。换句话说,CoT-Pass@K 提升可能只是"对推理过程打标"这一行为的副产品,而不是 RLVR 本身的功劳。
  • 理论模型的假设过强:隐式激励"正确推理"需要假设"answer correctness ⇒ process correctness" 的概率单调性。这一假设在分布外、组合性推理、长链 CoT 上未必成立,论文没给出失效边界。
  • 基线选择问题:对照是 base 模型本身 + SFT 蒸馏模型;但没有对比同样算力预算下的 SFT-on-CoT——这是 PRM 流派和 Skywork-OR1 同期工作的标准对照。
  • 数据与评测可能污染:数学任务用 AIME 类,代码任务很可能在 HumanEval / MBPP 训练集上做过 SFT;论文未给出对"训练-评测去重"的明确说明。
  • "激励"≠"获得":标题说"incentivizes",但理论只证明激励方向存在,未证明训练后真的获得了新推理模式。这一弱化措辞和 NeurIPS 2025 同议题 poster 的实验结果直接冲突。

1.3 可信度判断

  • 方法学层面:中-中上。指标设计有新意,理论有形式化;同行价值在于给"RLVR 派 vs PRM 派"一个共同讨论平台。
  • 实验层面:中下。复现数字低于原报告,缺 head-to-head PRM 基线,缺去重证据。
  • 立场层面:明显偏向"RLVR 仍然有效"的产业叙事;与 NeurIPS 2025 #119944(同一关键观点的对立实验)形成学术张力。
  • 总体方法论可学,实验结论需保留。建议作为"反方证据"入库,不建议作为"RLVR 有用"的最终判决。

1.4 复现难度

  • 算力门槛:32× MI300X + VERL 两周 ≈ 至少 8×H100 量级,普通实验室不友好。
  • 数据门槛:依赖 Skywork-OR1 完整训练配方(已开源)。
  • 代码门槛:VERL 框架成熟,但 CoT-Pass@K 评估脚本需自行实现。
  • 建议:作为复现优先级 P2 的论文,先做"小模型 + 短 CoT" 的缩减版验证 CoT-Pass@K 的有效性,再决定是否投入完整算力。

2. 对照立场 · NeurIPS 2025 Poster #119944

标题:Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model? 链接:https://neurips.cc/virtual/2025/poster/119944 定位:arXiv:2506.14245 重点反驳的 Yue et al. (2025) 立场的后续 / 扩展工作(同一作者群)。

2.1 核心论点

  • 跨多个模型族、RL 算法、数学/代码/视觉推理基准,在 Pass@K(K 较大)下 base 模型反超 RLVR 模型
  • RLVR 训练过程中 reasoning capability boundary 反而收窄(coverage narrowing)。
  • 6 种主流 RLVR 算法表现相似且远未达到 base 模型的天花板——base 模型可视为 upper bound。
  • 蒸馏(distillation)才能真正扩展推理能力

2.2 与 1.x 论文的对峙点

维度 arXiv:2506.14245v2 NeurIPS 2025 #119944
指标 CoT-Pass@K Pass@K(K 较大)
RLVR 是否扩展 base (仅提升效率)
边界行为 早期即提升 训练中收窄
蒸馏 vs RLVR 未对比 蒸馏 > RLVR
建议方向 RLVR + CoT 评估 需新范式(continual scaling、多轮 agent)

2.3 批判视角

  • K 大的 Pass@K 是否有意义值得追问:K 大意味着容许数千次采样,对生产部署意义有限(成本 / 延迟不可接受)。这削弱了论文结论的现实意义。
  • 但反过来,CoT-Pass@K 的"过程正确"标注同样可能被人为构造——这削弱了 1.x 论文的现实意义。
  • 真正的结论可能是:两边都没错,但都在自己定义的指标上证明自己。学界需要的是统一指标 + 大规模盲评,而不是继续各做各的。

2.4 可信度

  • NeurIPS 2025 poster 接收意味着审稿人对实验广度(多模型族、多算法、多基准)有正面评价。
  • 没有开源训练脚本的承诺在摘要里出现,需进一步核实 openreview 上的 reviewer 评论和补充材料。

3. Substack 补充思想(仅 1 条)

来源:Cameron R. Wolfe, "Agentic RL: Frameworks and Best Practices" 链接:https://cameronrwolfe.substack.com/p/agentic-rl 类型:行业实践综述 作用:作为"RLVR 接下来往哪走"的工程视角补充。Cameron 在文中明确把"continual scaling + multi-turn agent-environment interaction"列为 RLVR 范式下一步——这与 NeurIPS 2025 #119944 的结论方向一致。 可信度:作者为分布式训练 / RL 工程背景作者(写过 LLM RL 完全指南),技术综述质量稳定,但不是同行评审使用规则合规性:仅作为研究线索,不复制长段,只引用观点与链接。


4. 综合判断

  • 是否建议入库
  • arXiv:2506.14245v2 → 建议入库,但归类为"争议性 / 复现脆弱",标注"反方立场"。
  • NeurIPS 2025 #119944 → 建议入库,归类为"正方 / 否定 RLVR 扩展性"。
  • 两条记录应在主题页互相链接,形成"立场对照"对子。
  • 是否值得精读全文:仅 arXiv:2506.14245v2 值得精读方法学部分(CoT-Pass@K 定义 + 理论证明),其余摘要 + reviewer 评论足够。
  • 是否值得做主题页更新:建议在 notes/rl-post-training.md 下新建子节 "RLVR 是否真的扩展推理能力",把两篇论文并列陈列,作为"指标定义之争"的典型案例。
  • 是否需要复现P2 优先级,建议先用 1.5B-3B 模型 + 短 CoT 任务做"指标敏感性"研究,再决定是否上完整算力。

5. 建议写入路径(GitHub-ready 草稿,仅供同步任务使用,本实例不执行 Git 写入)

  • notes/papers/2025-rlvr-implicitly-incentivizes-correct-reasoning.md
  • notes/papers/2025-neurips-rlvr-passk-saturation.md
  • notes/rl-post-training.md(主题页新增子节"RLVR 是否真的扩展推理能力")
  • reviews/2025-09-rlvr-debate-position-paper.md(可选,立场综述)

6. 分类标签

  • rl-post-training
  • rlvr
  • reasoning
  • reproducibility-crisis
  • metric-debate
  • microsoft
  • neurips2025
  • multi-method-failure
  • critical-read

7. 待补查(标注原因)

  • arXiv:2506.14245v2 的 CoT-Pass@K 实现细节(需抓论文 Appendix A)。
  • NeurIPS 2025 #119944 的 OpenReview 评论与补充材料(需查 OpenReview 链接,目前未拿到)。
  • Cameron Wolfe 文中引用的 Ragen-2 (arXiv:2604.06268) 编号格式异常(2604),需在主题页里做 arXiv 编号核验。

本稿不复制论文长段;不执行 git commit / push / gh pr。