Rethinking Critic Learning in PPO: Understanding and Mitigating Value Flattening

  • 关联论文:2609.18708
  • 作者:Tom
  • 更新:2026-09-17

一句话结论

PPO 在 LLM 训练中使用的 Critic 网络存在一个系统性缺陷——Value Flattening(价值扁平化):状态价值在中间状态之间急剧变化,但 Critic 的预测却相对平坦,导致策略更新失去有效信号。SP³O 通过在每个 response 中仅对少量稀疏分布的状态施加价值损失,从根本上缓解了这一问题,在 Qwen3-Base 多个规模上均取得一致提升。

解决什么真问题

PPO(Proximal Policy Optimization)是 LLM 后训练(RLHF)的核心算法家族之一。在 LLM 场景中,PPO 通常配备一个 Critic(价值网络) 来估计状态价值,从而降低策略更新的方差——类似于在游戏 AI 中用 Critic 评估棋局优劣。

然而,作者发现了一个系统性的 Critic 失效模式:当用多个 Monte Carlo continuations(从同一状态出发的多条采样轨迹)来估计状态价值时,真实状态价值在不同中间状态之间可能变化剧烈,但 Critic 的预测值却趋于平坦。换句话说,Critic 学会了"平均地正确"而不是"精确地正确"——它的预测方差远小于真实价值的方差,导致策略梯度信号被削弱。

这在 LLM 场景中尤其严重,因为 LLM 的 state space(token 序列空间)极其庞大,中间状态之间的语义差异细微但累积效应巨大,Critic 更容易趋于保守预测。

核心方法

Value Flattening 的形成机制

作者从理论和实验两个角度分析了 Value Flattening 的根源:

理论分析:将 Value Flattening 归因于 Critic 损失函数中一个隐式方差惩罚(implicit variance penalty)。具体来说,Critic 的损失函数优化 MSE 目标时,天然倾向于降低预测方差,而低估状态间价值差异——因为 MSE 同时惩罚偏离均值的高估和低估,保守预测(方差小)通常 MSE 更低。

时序相关性冗余更新:在 LLM 的 response 生成过程中,相邻 token 对应的隐状态具有高度相似梯度,导致 Critic 在相邻状态上收到冗余的梯度更新,进一步强化了平坦化趋势。

SP³O:Sparse Proximal Policy Optimization

针对上述两个根源,SP³O 的解法简洁而精准:在每个 response 中,只对少量(few)、相互之间有适当距离(well-separated)的状态施加价值损失

具体而言,对于每个 response sequence,SP³O 做以下处理:

SP³O 算法核心(推断):

对于每个 response 中的所有 token 位置 {1, ..., T}:
  1. 选择 K 个稀疏分布的状态索引(well-separated,如等间隔采样)
  2. 仅对这 K 个状态计算价值损失
  3. 其余状态的价值损失置零

优化目标变为:
  L_total = E[ Σ_{t ∈ SelectedStates} (V(s_t) - V_target(s_t))² ]

这样做有两个直接效果: - 缓解隐式方差惩罚:只对少数状态施加损失 → Critic 无法通过"平均化"来降低整体 MSE → 必须更精确地拟合每个被选中状态的价值 - 打破时序冗余:被选中的状态之间有足够间距 → 梯度信号不再被相邻相似状态稀释 → 每个更新都是独立有效的信息

关键实验配置

配置
实验模型 Qwen3-Base(多个规模)
每 response 监督状态数 仅 3 个(极其稀疏)
状态选择策略 Well-separated(等间隔或类似策略)
基准算法 标准 PPO(每个 token 都施加价值损失)

关键实验与数据

  • 核心发现:即使每 response 仅监督 3 个状态,SP³O 依然能够缓解 Value Flattening,并且一致提升所学策略的质量
  • 跨模型规模:从 Qwen3-Base 的多个规模变体上均观察到改进,说明 SP³O 的效果不是特定规模下的偶然
  • 跨评测套件:在多个 evaluation suites 上均取得提升,具有普遍性

⚠️ 存疑:原文 abstract 截断,具体绝对数值(如 policy 提升百分比、bits-per-byte 改进等)和与 GRPO、PPO-UX 等方法的对比数据未披露,建议阅读 PDF 获取完整实验数据。

FrozenLake 验证实验

作者在一个受控的 FrozenLake 环境中验证了 Value Flattening 现象的存在,并确认该现象随状态空间增大而加剧——这为 LLM 这样拥有巨大状态空间的场景提供了有力类比。

亮点与局限

亮点:

  1. 诊断价值极高:Value Flattening 之前未被明确命名和系统分析,这篇论文是首个深入剖析 PPO Critic 在 LLM 场景下系统性失效机制的工作,具有重要的学术价值
  2. 解法简洁有效:SP³O 不引入新架构、不增加计算量,仅通过改变"哪些状态计算损失"来实现缓解——工程实现成本极低
  3. 稀疏监督的意外优势:原本直觉上会觉得减少监督状态数量会损失信息,但实验证明稀疏 well-separated 的监督反而因为消除了冗余梯度而更有效——这是一个反直觉的发现
  4. 跨规模普遍有效:在 Qwen3-Base 多个规模上均有效,说明该问题的根源(方差惩罚 + 时序冗余)与模型规模无关,是 PPO Critic 本身的结构性问题

局限:

  1. 仅测试 Qwen3-Base:缺乏在 Llama、GPT 等其他 LLM 架构上的验证,泛化性待确认
  2. 状态选择策略细节未披露:具体的 well-separated 选择算法(等间隔?随机但有最小间距?)在 abstract 中未披露,实现时需要参考原文
  3. RLHF 整体效果未知:实验仅评估了"学到的策略质量",未披露最终 LLM 的 assistant 质量(如 Helpful/Harmless 分数),与 DPO、PPO 等方法的端到端对比数据缺失
  4. 理论分析尚浅:隐式方差惩罚的机制是理论推断,缺少像 GDBA(Gradient-Driven Critic Learning)那样严格的数学推导

对工程落地的启发

  1. LLM PPO 训练调优:在训练 LLM 的 PPO 阶段时,可以考虑将价值损失稀疏化——仅对 sequence 的关键位置(如 answer boundary tokens、decision tokens)计算价值损失,而非每个 token 都计算,可能获得更稳定的训练
  2. 减少 Critic 更新频率:如果实现 SP³O 有难度,一个简化策略是降低 Critic 的更新频率(即增加 PPO 的 critic_update_freq 间隔),让每次 Critic 更新之间有更多环境交互,减少时序冗余梯度
  3. 调试 PPO 训练不稳定:Value Flattening 提供了一个新的排查方向——当 PPO 训练 loss 震荡但 reward 不见涨时,可以检查 Critic 预测的方差是否过小
  4. 状态空间缩小的代理任务:FrozenLake 实验显示 Value Flattening 随状态空间增大而加剧,这意味着在设计 LLM RLHF 评测时,可以先在 FrozenLake 或类似低维环境中诊断 Critic 行为,作为 LLM 场景的代理

与同方向工作的关系

工作 核心问题 解决方案
PPO(原始) 策略更新高方差 引入 Critic 估计价值
GRPO(DeepSeek) PPO 计算成本高 无 Critic 替代方案
DPO / KTO PPO 训练不稳定 直接偏好优化(绕过 Critic)
GDBA Critic 学习效率低 梯度驱动 Critic 更新
SP³O Value Flattening 稀疏价值损失

SP³O 与 GDBA 的关系最密切——两者都聚焦于 Critic 学习过程的改进。但 GDBA 通过梯度驱动更新来解决 Critic 学习效率问题,而 SP³O 从稀疏监督角度出发,本质上是降低了 Critic 的学习难度(减少了错误信号的干扰)。

与 DPO/KTO 等无 Critic 方法的关系是:互补而非替代。DPO 等方法绕过了 Critic,但 Critic 在某些需要价值估计的场景(如需要 baseline 的 Advantage 估计)仍有存在价值。SP³O 的贡献是让 Critic 在保留的情况下工作得更好。

适合谁读

  • LLM 后训练工程师:关注 PPO / RLHF 训练调优、Critic 行为分析
  • RL 算法研究员:对 PPO Critic 失效机制、稀疏监督的理论和实践感兴趣
  • LLM Infra 工程师:负责 RLHF 训练系统搭建,需要理解为何 PPO 有时不 work
  • RLHF 评测研究者:Value Flattening 提供了一个新的诊断角度,可以帮助分析 RLHF 实验中的异常现象

⚠️ 存疑:论文具体实验数据(绝对分数、相对提升幅度)、与 GRPO/DPO 的端到端对比、以及 SP³O 在非 Qwen 架构上的泛化性均未在 abstract 中披露,建议阅读 PDF §3–§5 获取完整实验细节和消融分析。