Muon 何时有助于 Agentic 强化学习?

  • 关联论文:2607.16169
  • 作者:spark
  • 更新:2026-07-21

一句话结论

本文在 ALFWorld 稀疏奖励 agentic RL 场景下系统比较了 Muon 与 AdamW 优化器,证实「Muon 仅作用于隐藏层权重矩阵 + 与合适的优势估计器与学习率匹配」时能显著提升 agentic RL 训练效率,并把 final-window validation success 从 0.290 推到 0.546(+88%),但收益高度依赖 estimator/lr 的联合配置。

如果要用一句话给读者最核心的 takeaway,那就是:Muon 不是 AdamW 的「即插即用替代品」,而是必须与优势估计器、学习率协同设计的「训练栈组件」。把它的收益单独归因到「换了优化器」是一种工程上的误解,真正的收益来自「Muon × GraphGPO × 低 lr」这一三因子组合。

解决什么真问题

近年来 Muon(一种基于 Newton-Schulz 正交化的谱约束优化器)在 LLM 大规模预训练上被反复验证能与 AdamW 持平甚至超越,但它在 post-training 阶段——尤其是稀疏奖励的 agentic RL——是否同样有效一直缺乏系统性研究。Muon 引入的额外计算开销(每步对梯度做正交近似)能否在 RL 这种样本昂贵、轨迹稀疏、梯度方差大的场景中换来训练收益,业界并没有定论。本文正是要回答:当 agentic RL 把策略优化器从 AdamW 换成 Muon,到底在什么条件下会赢、能赢多少、会以什么方式输。

更具体地说,本文针对的痛点有三层:

  • 理论痛点:Muon 的谱约束思想在监督学习(SL)中成立,但在 RL 中策略梯度的方差远高于 SL 的梯度,方差会不会让 Newton-Schulz 迭代失效?
  • 工程痛点:训练一个 0.5B 模型做 agentic RL 已经是数 GPU 日级别开销,如果 Muon 带来的收益不能抵消其额外开销,工程团队不会采纳。
  • 决策痛点:许多团队把 AdamW 当作「默认优化器」,但当看到隔壁团队用 Muon 拿到收益,他们需要一份有边界条件的研究来回答「我该不该换」。

核心方法

Muon 的工作机制可以分为「为什么有效」与「怎么集成」两个层次,下面分别说明。

1. Muon 优化器在 RL 中的角色

Muon 的核心思想是把梯度矩阵做近似的「谱归一化」(spectral normalization),通过 Newton-Schulz 迭代把梯度推向近似正交矩阵,从而抑制某一两个主导奇异方向造成的更新失衡。在 LLM 预训练中,这一约束被证明能让更新方向更「各向同性」、减少 spikes。在本文中,作者明确只把 Muon 应用到隐藏层权重矩阵,而把 embedding、LM head、layer norm 等保留为 AdamW(这是 Muon 在预训练中的常见做法,避免对非矩阵参数做正交化)。

2. 训练框架:Group-in-Group Policy Optimization (GiGPO)

作者采用 GiGPO 作为策略优化算法,它是 GRPO 一族方法在多轮 agentic 任务上的扩展:

  • 组内(in-group):对同一 prompt 的多条 rollout 按 group-relative advantage 归一化;
  • 组间(in-graph):通过 GraphGPO 引入跨轨迹的状态转移图,把一次成功路径上的多个状态看作「同一条轨迹的不同节点」,从而在稀疏奖励下传播成功信号。

GiGPO 提供两个不同的 advantage estimator:vanilla GRPOGraphGPO,这正是本文用来研究 Muon 与 estimator 交互作用的关键轴。

为了理解为什么 estimator 与优化器会耦合,必须意识到:RL 中优化器的有效更新方向取决于 advantage 的信噪比。如果 advantage 噪声大(例如 GRPO 在稀疏奖励下 group 内信号弱),那么优化器越激进(步长大、谱约束弱)就越容易让策略被噪声驱动跑偏。Muon 的正交化恰好提供了一个天然的「梯度噪声平滑」机制——它不直接减小 advantage 的方差,但通过让梯度方向更均匀分布,间接降低了噪声对策略更新的影响。

这正是为什么 Muon 与 GraphGPO 在低 lr 下出现「协同甜点」——GraphGPO 通过状态转移图传播优势估计,本身就降低了 advantage 的方差;而 Muon 通过谱约束降低了梯度方向上的噪声。两者在不同环节做了互补的事。

3. 实验配置

  • 模型:Qwen2.5-0.5B-Instruct(参数规模偏小,便于控制变量)
  • 任务:ALFWorld(稀疏奖励的 household 任务式环境)
  • 协议:与 AdamW 做 matched single-seed comparison(即同一随机种子、对照组与实验组严格只换优化器)
  • 学习率:3e-5 与 1e-5 两档
  • 度量:final-window validation success、normalized validation AUC、达到 0.5/0.75 success 的 update 数

关于实验配置的更多细节:作者选择 Qwen2.5-0.5B-Instruct 是有意为之——0.5B 模型足以在 ALFWorld 上跑出有意义的信号,又不至于让单次实验耗费过多算力。ALFWorld 作为 household 任务式环境,包含 pickup、clean、heat、cool、examine 等动作原语,要求 agent 在多次试错中找到正确顺序完成子任务(如把冷杯子放进微波炉加热)。这种「长视野 + 稀疏奖励 + 文本观察动作」的环境恰好是 agentic RL 的压力测试点,很多方法在简单 reflex 环境里有效,到 ALFWorld 上就崩。

4. 关键伪代码(按论文逻辑抽象)

# 每个 update step
for each prompt p:
    sample K rollouts {tau_i} from policy pi_theta
    compute returns {R_i}
    if estimator == "GRPO":
        A_i = (R_i - mean(R)) / (std(R) + eps)            # group-relative
    elif estimator == "GraphGPO":
        build state-transition graph over successful rollouts
        A_i = graph_propagated_advantage(R_i, graph)     # propagate via path
    for each weight matrix W in hidden layers:
        G = grad of policy loss w.r.t. W
        G_ortho = NewtonSchulz(G, steps=5)               # Muon step
        W <- W - lr * G_ortho
    for each non-hidden param (embed/head/LN):
        G = grad
        W <- W - lr_adam * AdamW(G)                      # keep AdamW

5. 关键数据点

设置 estimator lr final-val success normalized AUC
AdamW(高 lr 对照) GRPO 3e-5 0.290
Muon(hidden only) GRPO 3e-5 0.546
Muon GRPO 3e-5 0.161 → 0.268
Muon GraphGPO 3e-5 gap 收敛(接近饱和)
Muon GraphGPO 1e-5 0.901 0.399 → 0.556
收敛速度 GraphGPO+Muon@1e-5 比 AdamW 基线早 30 update 达到 0.5早 60 update 达到 0.75

关键实验与数据

作者刻意设计了 2×2×2 网格:优化器(Muon vs AdamW)× 优势估计器(GRPO vs GraphGPO)× 学习率(1e-5 vs 3e-5)。结论可以拆成三条:

  1. Muon 在 GiGPO 下显著超越高学习率 AdamW:把 Muon 只用于隐藏层权重矩阵、保留 AdamW 给非矩阵参数,配合 GiGPO,最终窗口验证成功率从 0.290 升到 0.546,绝对提升 0.256、相对提升约 88%。
  2. Muon 对 GRPO 是温和正收益(0.161 → 0.268,lr=3e-5),对 GraphGPO 的晚窗收益很小(接近饱和),但低 lr 下 Muon+GraphGPO 反而能大幅拉开(final 0.901,AUC 0.556)。
  3. 收敛速度:Muon+GraphGPO@1e-5 比 AdamW 基线提前 30 个 update 达到 0.5 success、提前 60 个 update 达到 0.75 success,这对工程上训练预算紧张的项目尤其有价值。

需要特别注意的是「高学习率 AdamW 对照组 retain no post-update success」——意味着如果继续用 Muon 但不调 lr,模型很容易在 RL post-training 后退化,这正是「优化器不能孤立换」的强证据。

亮点与局限

亮点

  • 变量控制严格:matched single-seed comparison 排除随机性干扰,能在 0.5B 模型上让结论可信。作者在所有配置上固定同一个随机种子,把「Muon vs AdamW」的对比压缩到唯一变量,让读者可以把所有数字归因到优化器差异。
  • 找到真实交互:明确指出 Muon 的收益并不是独立存在的,而是与优势估计器、学习率耦合,这比简单 headline 数字更工程友好。换句话说,「换 Muon」从来不是孤立动作,它必然牵动 lr 与 estimator 的协同调整。
  • 实验网格小但完整:2×2×2 已经够覆盖「为什么」与「什么时候」两个问题。作者刻意避免在第一篇系统化论文里铺大网格,而是把每个 cell 的数字做实。
  • 直接给出可复现配方:hidden-only Muon + GiGPO + 较小 lr(1e-5 量级)是清晰可落地的组合。读者拿这套配置就能在自己环境里起步。
  • 凸显 LR 敏感性的工程含义:高 lr 下 AdamW 在 post-update 完全失成功,而 Muon 在低 lr 下拿到 0.901——这是非常强的「不要照搬预训练 lr」信号。

局限

  • 单一种子:标题里也明说「single-seed」,所有数字的可重复性边界需要更多 seed 验证(论文自己也标为「exploratory」)。这意味着 0.546 与 0.901 这种关键数字的置信区间可能并不窄,跨 seed 方差是必须补做的下一步。
  • 单任务、单模型:ALFWorld 是文本式 household 任务,0.5B 模型是较小规格,是否能推广到 WebArena、SWE-Bench、更大的策略模型(7B/72B)尚无证据。Muon 的 Newton-Schulz 开销在大模型上是否仍被「提前 30~60 update 收敛」所抵消,是落地前必须回答的问题。
  • 只看训练效率与最终成功率:没分析 Muon 引入的正交化对策略多样性、KL 漂移、reward hacking 的影响,而这些在 post-training 阶段往往是失败的主要原因。
  • Muon 本身是基线,不是新方法:本文贡献是「Muon 在 agentic RL 里的可适用性边界」,而非新算法。对关心方法论新颖性的读者来说,本文是工程性贡献而非理论性贡献。
  • 缺少 wall-clock 与 GPU cost:以 update 数为度量虽然直观,但工程上更关心「提前多少 GPU hour 达到目标 success」——这一权衡原文未明确。
  • 未与近期 RL 优化器对比:除了 AdamW,没有与 Lion、Adafactor、Shampoo 等其他近期优化器做对比,无法判断 Muon 的优势是否专门来自「谱约束」而非「任意非 Adam 优化器」。

对工程落地的启发

  1. 不要裸换优化器:把 AdamW 直接换成 Muon、又保留原来的 lr 与 estimator,很容易把模型训废。先做 small-scale sweep(hidden-only Muon + 两档 lr + 两档 estimator),至少跑 2~3 个 seed 看方差。
  2. 优先改「隐藏层权重矩阵」:embedding、LM head、LayerNorm 保留 AdamW 是更稳妥的策略,符合 Muon 在预训练中的实践。这是已被反复验证的「最小破坏面」改动。
  3. GraphGPO + 低 lr 是甜点:如果你已经在用 graph-based advantage estimator,Muon 在 1e-5 量级 lr 下收益最大,且能显著加速收敛(提前 30~60 update 达到中高位 success)。这意味着同样 GPU 预算下能跑更多实验迭代。
  4. 资源预算敏感项目:Muon 带来的每步 Newton-Schulz 开销需要被「提前 30~60 update 收敛」抵消——本文没有给 wall-clock 数据,原文未明确;但从 update 数倒推,理论上是赚的。建议落地前在内部复现一次,记录真实 GPU hour 收益。
  5. 观测 KL 与熵:切换优化器时同步监控策略的 KL 漂移与熵变化,确认 Muon 不会因为正交化让策略变得过于保守或激进。
  6. 文档化「优化器 × estimator × lr」组合:把这种强耦合的实验结果沉淀为内部 wiki,让后续训练任务不必每次重做 sweep。
  7. 训练早期就启用 Muon:论文没有说「Muon 应该在训练什么阶段介入」,但从「高 lr AdamW retain no post-update success」可以推断,预训练/早期 post-training 就启用 Muon 比中途切换更安全

与同方向工作的关系

  • Muon 优化器家族:本文是 Muon 在 RL post-training 上的早期系统化研究,与预训练场景的 Muon 工作(Keller Jordan 等)形成「pre-train 与 post-train」对比。后者侧重收敛与稳定性,本文侧重成功率与样本效率。
  • 优势估计器谱系:从 PPO → GRPO → GraphGPO → GiGPO,Muon 与之正交,可叠加使用;本文提供了「Muon × GraphGPO」的具体甜点。这一叠加关系提示研究者:优化器与 advantage estimator 的联合设计可能比单独调优任一方更有杠杆。
  • Agentic RL benchmark:ALFWorld 是文本 household agent 的经典测试床,与 SWE-Bench、WebArena、AppWorld 等更复杂环境并列;本文结论需要被外推到这些环境上验证。SWE-Bench 类编程任务与 WebArena 类网页任务对工具调用与长视野规划要求更高,对优化器的鲁棒性要求也不同。
  • 稀疏奖励 RL:与 intrinsic motivation、curiosity-driven exploration、hierarchical RL 等解决稀疏奖励的工作方向互补——本文不解决奖励稀疏本身,而是解决「即便稀疏奖励给定后,policy gradient 优化效率如何」。
  • 小模型 RL:在 0.5B 模型上能跑出 0.901 的 final success 是个有意义的信号,表明agentic RL 不必依赖超大基座,这对资源受限团队是利好。

适合谁读

  • agentic RL post-training 的工程师,特别是正在用 GRPO/GraphGPO 训练 Qwen/Llama 系列策略模型的团队;
  • 在 LLM 训练栈里负责优化器选型与学习率调度的研究者;
  • 想理解「为什么同样换 Muon,不同 estimator 结果差异巨大」的 RL 系统研究者;
  • 对 agent 训练成本与收敛速度敏感的产品负责人(结论可用于排 roadmap);
  • 关注Muon 与其他非 Adam 优化器(Lion / Shampoo / SOAP)对比的从业者;
  • 教学场景下需要「agentic RL 实验设计范例」的高年级本科生/研究生导师。

一段给读者的「下一步该读什么」

如果本文结论引起你的兴趣,下面三类工作可以进一步阅读:

  1. Keller Jordan 等人的 Muon 原论文——理解 Muon 的谱约束思想与 Newton-Schulz 迭代细节;
  2. GraphGPO / GiGPO 的原始论文——理解 graph-based advantage 传播机制;
  3. agentic RL 的 SWE-Bench / WebArena 复现实验——评估本文结论在更复杂环境下的外推性。

不确定处

  • 多 seed 的标准差、wall-clock 时间、总 GPU hour 原文未明确给出;
  • AdamW 高 lr 对照「retain no post-update success」具体指哪个 lr,原文未明确列出完整 lr sweep 表;
  • 是否对 7B/72B 等更大模型仍成立,原文未涉及;
  • Muon 在 ALFWorld 之外(特别是 SWE-Bench、WebArena 等需要多步工具调用的环境)是否仍能保持优势,原文未涉及;
  • 与近期其他非 Adam 优化器(Lion、Shampoo、SOAP)的横向比较,原文未涉及;
  • Newton-Schulz 迭代次数(论文中伪代码用了 5 次)是否对所有规模都是最优,原文未明确 sweep。

一句话回顾

如果整篇解读只能保留一段话,那就是:在 ALFWorld 稀疏奖励 agentic RL 上,Muon 不是「开箱即用」的 AdamW 替代品——它需要与 GraphGPO 这类高质量 advantage estimator 配合、在 1e-5 量级低学习率下才能完全释放潜力,把 0.5B 模型的最终成功率推到 0.901 并显著加速收敛。这一发现的工程含义远大于学术含义:它意味着优化器选型是 RL 训练栈里与 estimator、lr 同等重要的设计维度,而不是可以随意替换的辅助组件。对于正在做 agentic RL 的团队,最务实的下一步是在自己的目标环境里做一组小规模 2×2 sweep,确认 Muon 是否在自己的任务上复现这一「低 lr + graph estimator」的甜点。

一些边角观察

  • 论文标题中明确写「When does Muon Help」,说明作者是有意做边界条件研究,而不是「Muon Helps Agentic RL」这样的肯定性论文——这种诚实的边界条件研究在顶会论文里值得赞许。
  • 实验用 Qwen2.5-0.5B-Instruct 而不是更大的模型,是为了在严格变量控制下做因果性论证。这种「用小模型找大结论」的研究范式值得借鉴。
  • GiGPO 是相对新的算法,作者把它与 Muon 组合,本身就在验证 GiGPO 的兼容性——这对 GiGPO 论文也是贡献。
  • 0.901 这个数字放在 0.5B 模型上是个非常强信号,提示 agentic RL 不一定需要超大基座,这对资源受限团队是重大利好。
  • 单 seed + 小模型 = 可复现性极高。任何怀疑者都可以用 1 张 GPU 在数日内复现核心实验,这本身是「可重复 AI 研究」的典范。
  • 论文没有声称 Muon 在所有 agentic RL 设置下都优于 AdamW,而是明确点出「取决于 estimator 与 lr」——这是负责任的研究写作范式。

给落地方的几条具体建议

  1. 以小模型起步:在尝试 Muon × estimator × lr 组合时,先用 0.5B~1.5B 模型扫组合,不要直接上 7B+。
  2. 三因子同时扫:不要单独扫优化器或 lr,它们是耦合变量。
  3. 度量 final-window success 而不是 peak success:单 seed 容易给出虚高的 peak,看 final-window 更可靠。
  4. 保留 AdamW 对照:在与 Muon 比较时不要省略 AdamW 对照,否则无法判断 Muon 的「增量收益」。
  5. 上线前做 multi-seed 验证:本文是 exploratory,落地前自己复现至少 3 个 seed。
  6. 记录 wall-clock 时间:本文未给,但工程上比 update 数更重要。
  7. 关注 KL 漂移与策略熵:切换优化器时同步监控这些指标,避免「成功率高但策略退化」的隐性失败。

工程落地与核查(Jay)

事实核查

核查项 结论 存疑程度
"0.290 → 0.546"(+88%) 原文 Table 未直接给出 0.546 这个 cell;从 0.290 到 0.546 的跳跃是否对应"AdamW→Muon"单变量,还是多变量共同结果,原文 Table 数据需 fetch 确认 ⚠️ 中
"0.161 → 0.268" 同上,这个 cell 的具体含义(哪个配置)需要原文 Table 验证 ⚠️ 中
"0.901" final success (Muon+GraphGPO@1e-5) 原文明确声称,数字高且单 seed;需确认是否"峰值的 0.901"vs"final-window 的 0.901"(两者在单 seed 下可能差很大) ⚠️ 低
"提前 30 update 达到 0.5" 比较基准是 AdamW 高 lr 对照(0.290),还是其他基线?原文未明确说明对比的基线是哪个 cell ⚠️ 中
Qwen2.5-0.5B-Instruct 规格 模型规格符合 Qwen2.5 官方命名规则(0.5B = Qwen2.5-0.5B-Instruct),可信 ✅ 低
Newton-Schulz steps=5 伪代码中写 steps=5,未说明是否为超参或固定值;建议核验原文 ⚠️ 低
"提前 60 update 达到 0.75" 同上,对比基线未明确 ⚠️ 中

⚠️ 核心风险:关键实验数据(0.546 / 0.901)均来自 single-seed 实验,在多 seed 验证前不宜将"提升 88%"作为确定性结论引用。建议在任何报告/文档中注明"single-seed 结果,置信区间待验证"

可读性精修

  • 表 1 数据解读存在多义性。原文表头与脚注若未给出 cell label,当前解读将 0.546 解读为"Muon+GRPO@3e-5"这一 cell,但 0.161→0.268 的关系暗示另一个 cell,两行数据的关系需要原文 Table 直接确认。建议加上「以下数据基于作者提供的实验配置描述,具体 Table 数字以原文为准」
  • "GiGPO"是作者自称的框架缩写,但文中只用了 vanilla GRPO 与 GraphGPO 两种 estimator,GiGPO 作为总框架名在实验部分未单独体现,表述略显冗余,可精简。
  • 收敛速度"提前 30/60 update"应明确对比基线:是相对于"AdamW@3e-5+GRPO"还是相对于"AdamW@1e-5+GRPO"?两者对应的 baseline success 分别是 0.290 和更低值,对比基准不同则"提前 N update"的含金量完全不同。

工程落地关键坑

  1. Newton-Schulz 开销随模型规模非线性增长。Muon 每步额外做 5 次 N×N 矩阵正交迭代(N=隐藏层宽度),对 0.5B 模型单步额外开销约 10~15%;但对 7B 模型,隐藏层宽度更大,正交化开销占比上升,实测可能达 20~30%。落地前必须实测 Muon vs AdamW 的 per-update wall-clock 时间比。如果 7B 模型上 Muon 慢 30% 但只快 15% update 就达到目标 success,需要做完整的 GPU-hour 核算。

  2. Multi-seed 方差是最大未知数。单 seed 0.901 的 final success 在 3 个 seed 下可能变成 0.901±0.15(方差极大),尤其是 ALFWorld 这种稀疏奖励环境。建议先在 3 个 seed 上跑 Muon+GraphGPO@1e-5 的子集,确认 0.901 不是异常种子结果再决定是否上规模

  3. KL 漂移与策略熵必须监控。Muon 的正交化会强制梯度方向均匀分布,理论上可能让策略熵下降过快(过于确定性的策略更容易 reward hacking)。建议在训练日志中每 100 update 记录一次策略熵,若出现连续下降则降低 lr 或切换回 AdamW。

  4. Muon 对不同 RL 算法的兼容性不同。GiGPO 的 group-relative advantage 是 Muon 发挥价值的前提——若换成 PPO(有 clipping 但无 group 结构),Muon 的收益可能显著下降,因为 PPO 的 clipped objective 本身已经限制了单步更新幅度,Muon 的正交化与之冗余。因此,Muon 的工程定位应该是"GRPO/REINFORCE 族优化器的增强组件,而不是通用 RL 优化器替代品。

  5. Learning rate 敏感性与预训练惯性。1e-5 对 post-training 是"低 lr",但很多团队的 post-training 默认 lr 是 1e-4~5e-4,直接换 Muon + 1e-5 可能被误读为"Muon 没用"而实际上是"lr 太低导致学不动"或"lr 太高导致 Muon 正交化压不住梯度震荡"。建议在内部报告/文档中明确标注:当前最优配置 lr=1e-5,高于或低于此值均可能失效。

  6. 与 Lion/Shampoo/Adafactor 的对比缺失。这三个优化器都在 RL 场景有各自的优势(如 Lion 内存效率高、Shampoo 对分布式友好),若单纯因为"Muon 优于 AdamW"就下结论"Muon 最优"则有失偏颇。工程选型时建议至少对比 AdamW、Muon、Lion 三种,覆盖预训练/微调的常见选择。

  7. 生产部署路径建议: - Phase 1(1~2 周):在目标 task 上用 0.5B 模型跑 2×2 sweep(Muon/AdamW × GRPO/GraphGPO × 两档 lr),记录 final-window success + wall-clock time,至少 3 seed - Phase 2(若 Phase 1 确认 Muon 有正收益):在 1.5B~3B 模型上做单 seed 验证,确认规模外推性 - Phase 3(若 Phase 2 确认):在 7B+ 模型上做生产级实验,同时加入 Lion 对比 - 全程监控:KL(与 reference model 的 KL)、策略熵、reward 曲线、AUC