← 返回 2026-07-20

Muon 优化器在 Agentic 强化学习中何时有效 When Does Muon Help Agentic Reinforcement Learning?

Kai Ruan, Jinghao Lin, Zihe Huang, Ziqi Zhou, Qianshan Wei, Xuan Wang, Hao Sun 📅 2026-07-17 👍 14 2026-07-25 18:30
Agentic RL Muon 优化器 信用分配 强化学习

探究 Muon 优化器在不同优势估计器的长程 Agentic RL 中的效果

前置知识

Muon 优化器

Muon(Jordan et al. 2024)针对隐藏层 2D 权重矩阵,把动量累积梯度 $M$ 通过 Newton–Schulz 迭代近似正交化为 $\text{NS}_5(M)\approx UV^\top$,保留动量矩阵的奇异方向、丢弃奇异值幅度。embedding、norm、输出头等非矩阵参数通常用 AdamW 作为辅助优化器。它在十亿到万亿参数预训练中能用约 AdamW 一半 FLOPs 达到相近 loss。

本文通篇围绕 vanilla Muon 在 RL 后训练中是否成立展开,理解其谱白化机制是读懂增益与失效原因的前提。

GRPO / GiGPO / GraphGPO

三者都是 group-based RL 算法,区别在信用分配粒度。GRPO 用整条轨迹组内归一化的 episode 级优势 $A_E$;GiGPO 在其基础上加入由重复 anchor state 聚合的 step 级优势 $A_S$,组合优势 $A=A_E+\omega A_S$,当 $\omega=0$ 时退化为 GRPO;GraphGPO 把 rollout 聚成统一状态转移图,按 successor-state 到目标的距离赋 transition 级信用。

本文的核心设计就是固定优化器、变动这三种估计器,看 Muon 增益如何随之变化,这是理解全部实验结论的主轴。

梯度信噪比(SNR)与谱展平

在固定奇异方向模型下,Muon 极因子更新的期望对齐为 $\mathbb{E}\langle P(\widehat{G}),G^\star\rangle_F=\sum_i s_i[2\Phi(s_i/\sigma_i)-1]$,只有当弱方向 $s_i/\sigma_i$ 足够大、符号可靠时谱展平才提高与真信号的对齐。理想局部信用下 $\text{SNR}_{\text{local}}/\text{SNR}_{\text{episode}}\approx T/K$($T$ 步中仅 $K$ 步承载信号)。

作者用 SNR 猜想统合了既有 Muon 在低 SNR 单轮 RLVR 下失效与本文长程细粒度信用下受益两类矛盾现象,是方法新颖性的关键。

ALFWorld 长程稀疏奖励环境

ALFWorld 把家用具身任务文本化,含 Pick、Look、Clean、Heat、Cool、Pick Two 六类,单轨迹 horizon 最多 50 步,仅在任务成功时给稀疏终态奖励并附加一个小额无效动作惩罚,是多轮 agentic RL 的常用基准。

本文所有数值结论都建立在 ALFWorld 上,理解其长程、稀疏、多步特性才能判断结论对其它 RL 场景的外推性。

研究动机

Muon 优化器通过 Newton–Schulz 迭代对动量矩阵做谱归一化,在大规模预训练中可与 AdamW 匹敌,但其在强化学习(RL)后训练中的价值长期不明。现有证据高度矛盾:NVIDIA 的 NeMo RL 报告仅在 post-training 引入 Muon 带来“小幅改进”;而 Fan et al. (2026) 报告在 RLVR 配 GRPO 类目标时 vanilla Muon 完全失效,归因于谱白化放大了低信噪比(SNR)策略梯度中噪声主导的尾部方向。社区工程实践也记录了数学推理 RL 中持续出现的熵地板(entropy floor)和梯度爆炸;Hopper(Wei 2026a,b)则用方差归一化加单步 NS 来缓解。一个关键观察是:上述负面证据几乎全部集中在单轮 RLVR、仅用 episode 级(outcome-only)优势估计的场景,而多轮长程 agentic RL 下的系统对照仍属空白。

本文的目标是本文要回答一个聚焦问题:Muon 在 RL 后训练中是否可行、是否取决于优势估计器的结构?作者在 ALFWorld 长程稀疏奖励 agentic 环境上,用 Qwen2.5-0.5B-Instruct 训练智能体,系统比较一组覆盖不同信用分配粒度的 group-based RL 算法——GRPO(episode 级优势)、GiGPO(episode 级叠加由 anchor state 重复采样构造的 step 级项)、GraphGPO(把 rollout 聚合成统一状态转移图、按 successor-state 到目标的距离赋 transition 级信用)。目标是固定模型、数据、rollout 与训练调度,仅切换策略优化器(AdamW vs 仅对隐藏权重矩阵应用 Muon)与优势估计器,判断 Muon 的增益来自何处、在何种结构下稳定出现。

与已有工作不同的是,独特之处在于“控住一个变量、变动另一个”。以往 Muon-in-RL 研究多在单轮 RLVR 上做,且把优化器与目标函数混在一起评估;本文则把优化器固定为 vanilla Muon,单独地变动 RL 目标的信用分配结构。关键设计是 GiGPO 的组合优势 $A=A_E+\omega A_S$:当 step 权重 $\omega=0$ 时在 GiGPO 同一代码路径内严格退化为 GRPO 的 episode 级优势,从而避免引入第二套 GRPO 实现造成的混淆,能干净地分离 episode 级与 step 级贡献。作者还提出梯度信噪比(SNR)作为统合正反证据的组织假说:Muon 的正交化压平更新的奇异谱、放大弱方向,这只有在弱方向符号可靠时才有利,而更细粒度的信用分配可能提升弱方向信噪比。

核心方法

整体思路是“匹配对照实验 + SNR 机制猜想”。技术路线上,从 AdamW GiGPO 基线出发,把 Muon 只施加到策略的隐藏 2D 权重矩阵(注意力与 MLP 权重),embedding、norm、输出头等非矩阵参数仍用 AdamW fallback,从而与基线共享其余全部配置。Muon 的更新为 $\Delta W\propto \text{NS}_5(M)\approx UV^\top$,其中 $M=U\Sigma V^\top$ 是动量累积梯度,5 次 Newton–Schulz 迭代保留奇异方向、丢弃奇异值幅度。训练 200 个 update,每组 8 条轨迹、16 任务 batch,每 5 步在 128 个 episode 上评估,硬件 8×NVIDIA H20。三套优势估计器在同一环境/模型/调度下做 AdamW–Muon 配对比较,辅以学习率扫描与 $\omega$ 消融,并贯穿梯度 SNR 猜想来解释 estimator 依赖的差异。

核心创新是把“优化器是否生效”与“RL 信用分配的粒度”显式耦合分析,并提出一个可解释的机制猜想。Muon 通过近似极因子 $P(\widehat{G})=UV^\top$ 压平奇异谱,理论上对方向 $i$ 的期望对齐为 $\mathbb{E}\langle P(\widehat{G}),G^\star\rangle_F=\sum_i s_i[2\Phi(s_i/\sigma_i)-1]$,其中 $s_i$ 为信号系数、$\sigma_i$ 为高斯误差标准差——只有当弱方向 $s_i/\sigma_i$ 足够大、符号可靠时谱展平才提高与真信号的对齐。作者推导出信用信噪比缩放:理想局部信用下 $\text{SNR}_{\text{local}}/\text{SNR}_{\text{episode}}\approx T/K$($T$ 步决策中仅 $K\ll T$ 步承载信号)。这把 Fan et al. 的“低 SNR 导致 Muon 失败”与本文“长程细粒度信用下 Muon 受益”统一为同一连续谱,而非互斥结论。

方法步骤详情

步骤分六步。建基线:策略 AdamW 学习率 $1\times10^{-6}$,复用 Feng et al. GiGPO 基线。加 Muon:仅对隐藏 2D 矩阵用 Muon($\eta_{\text{muon}}=3\times10^{-5}$,动量 0.95、Nesterov、5 步 NS、weight decay 0.01),其余参数仍 AdamW $10^{-6}$ fallback。学习率对照:把 AdamW 从 $3\times10^{-6}$ 扫到 $3\times10^{-5}$,检验加大学习率能否复现增益。算法族对照:在 GRPO 与 GraphGPO 下各做 AdamW–Muon 配对,均含 Muon $10^{-5}$、$3\times10^{-5}$ 两档。step 信用消融:GiGPO 配对设 $\omega=0$ 与 $\omega=1$。评估用双口径——末窗口(step 175–200 的 6 次评估均值)与归一化验证 AUC(step 0–200 梯形)。实现用 FSDP NO_SHARD 把完整 2D 矩阵喂给 NS 迭代。

技术新颖性

新颖性有三层。其一,这是首次在长程、稀疏奖励 agentic RL 上对 vanilla Muon 做受控对照的研究——既有 Muon-in-RL 证据几乎都在单轮 RLVR,本文把战场换到 ALFWorld 长程任务(horizon 最多 50 步、稀疏终态奖励)。其二,方法论上同时变动优化器与优势估计器两个维度,并借助 GiGPO 的 $\omega$ 退化性把 episode 级与 step 级信用在同一代码路径内隔离,避免实现混淆。其三,提出梯度 SNR 猜想作为组织框架,用 $\text{SNR}_{\text{local}}/\text{SNR}_{\text{episode}}\approx T/K$ 与极因子对齐期望公式,把“低 SNR 单轮 RLVR 下 Muon 失效”与“细粒度信用下 Muon 受益”两类看似矛盾的现象统一解释,并给出可检验预测(细粒度信用应先改善弱尾方向符号一致性而非饱和终值)。这与 Pion(高通透波)、Hopper(方差归一化)等纯优化器侧补救方案互补。

实验结果

核心发现:(1) GiGPO 是主战场:末窗口成功率从 AdamW 的 0.290 跃升到 Muon($3\times10^{-5}$) 的 0.546,相对 +88%,最终 checkpoint 0.63 vs 0.32,是全文最大增益。(2) 该增益无法用“加大学习率”解释:学习率对照显示 AdamW 在 $10^{-5}$、$3\times10^{-5}$ 两档自 step 5 起验证成功全为 0.000,而 Muon 在 $3\times10^{-5}$ 下保留 0.633 成功。(3) 收益随估计器变:GRPO 增益最小(0.268 vs 0.161);GraphGPO 因基线已强(0.810)近饱和,但 Muon($10^{-5}$) 把归一化 AUC 从 0.399 抬到 0.556(+0.157)。(4) step 信用消融显示 Muon 在 $\omega=0$、$\omega=1$ 均提升,AUC 差随开 step 项由 +0.069 扩到 +0.127,提示二者协同;GraphGPO 第二 seed 复现稳健。结论:Muon 效果强依赖优化器–估计器配对。

Late-window quality and learning efficiency.
Table 1: Late-window quality and learning efficiency.
Learning-rate controls under the reported seed-0 GiGPO configuration.
Table 2: Learning-rate controls under the reported seed-0 GiGPO configuration.
Matched 2×2 GiGPO step-credit ablation.
Table 3: Matched 2×2 GiGPO step-credit ablation.
Matched GraphGPO replication.
Table 6: Matched GraphGPO replication.
Core training configuration.
Table 4: Core training configuration.
Muon improves late-window quality and learning efficiency, with learning-rate sensitivity that varies by advantage estimator.
Figure 1: Muon improves late-window quality and learning efficiency, with learning-rate sensitivity that varies by advantage estimator.
Per-task late-window mean validation success across all three estimators.
Figure 2: Per-task late-window mean validation success across all three estimators.
Matched optimizer diagnostics under GiGPO (top) and GraphGPO (bottom).
Figure 3: Matched optimizer diagnostics under GiGPO (top) and GraphGPO (bottom).
Matched GiGPO optimizer-by-step-credit ablation.
Figure 4: Matched GiGPO optimizer-by-step-credit ablation.
GiGPO learning-rate stress diagnostics.
Figure 9: GiGPO learning-rate stress diagnostics.
查看结构化数据
任务指标本文基线提升
ALFWorld / GiGPO 末窗口验证成功率(step 175–200 均值) Late-window success(越高越好) Muon($3\times10^{-5}$) = 0.546;$10^{-5}$ = 0.509;最终 checkpoint 0.633 AdamW($10^{-6}$) = 0.290;最终 checkpoint 0.320 末窗口相对提升 +88%(+0.256 绝对),最终 checkpoint 近乎翻倍
ALFWorld / GiGPO 学习率对照 Final-checkpoint success Muon($3\times10^{-5}$) = 0.633,全程保留成功 AdamW $10^{-5}$ 与 $3\times10^{-5}$ 均 0.000(step 5 起清零);$3\times10^{-6}$=0.234、$5\times10^{-6}$=0.070 高名义步长下 Muon 稳定收敛而 AdamW 完全崩溃,证明增益非来自加大学习率
ALFWorld / GraphGPO 归一化验证 AUC(step 0–200) Normalized validation AUC(越高越好) Muon($10^{-5}$) = 0.556;$3\times10^{-5}$ = 0.474;末窗口 0.901/0.828 AdamW($10^{-6}$) = 0.399;末窗口 0.810 AUC +0.157($10^{-5}$ 档),更早越过 0.5/0.75 阈值(step 80/110 vs 110/170),双 seed 复现增益 +0.138
ALFWorld / GRPO 末窗口与 AUC Late-window success / Normalized AUC Muon($3\times10^{-5}$) 末窗口 0.268、AUC 0.091;$10^{-5}$ 末窗口 0.185 AdamW 末窗口 0.161、AUC 0.078 末窗口 +0.107、AUC +0.013,是三种估计器中收益最小者
ALFWorld / GiGPO step 信用 2×2 消融 末窗口 success / Normalized AUC Muon($3\times10^{-5}$):$\omega=0$ 时 0.361/AUC 0.132,$\omega=1$ 时 0.546/0.241 AdamW:$\omega=0$ 时 0.141/0.063,$\omega=1$ 时 0.290/0.114 Muon 在两 $\omega$ 下均提升;开 step 项后 AUC 差由 +0.069 扩到 +0.127,提示协同

局限与改进

作者坦承这是一项探索性研究:仅用一个 0.5B 模型与单一 ALFWorld 环境;GRPO、GiGPO 及 $\omega$ 消融大多只用一个配置 seed,GraphGPO 只多一个匹配 seed,数值不能刻画种群级不确定性;学习率覆盖不均——GiGPO 有完整 AdamW 扫描,GRPO/GraphGPO 只有 Muon 两档与不完整 AdamW 扫描;机制证据是相关性的,未直接测量更新谱或梯度 SNR 来验证猜想;FSDP NO_SHARD 全矩阵实现增大单卡显存,扩展到更大模型需要分布式 Muon。我的额外观察:GraphGPO 在 $3\times10^{-5}$ 反而不如 $10^{-5}$,说明最优 Muon 学习率随估计器变化,缺乏统一换算规则(作者也承认 Muon 与 AdamW 学习率不可直接比较)会削弱实践指导性;0.5B 小模型上梯度 SNR 行为能否外推到大模型未知;seed-0 与额外匹配组里 $10^{-5}$ Muon 排序发生反转(Designated 0.509 vs 额外组 0.372),暗示 run-to-run 抖动不可忽视。

独立分析的弱点

独立分析的弱点与改进方向。(1) 规模外推性弱:仅 0.5B,建议在 3B–7B、不同预训练优化器来源的模型上重复,并报告 NO_SHARD 之外的分布式 Muon 结果。(2) 机制未被直接证实:SNR 猜想只是组织性假说,作者自己也列为未来工作。改进方向是按附录 D 的可检验预测,记录每层更新谱、有效秩、尾部投影信噪比与跨 mini-batch 符号一致性,做 AdamW–Muon 配对统计检验,把“相关”升级为“因果”。(3) 环境单一:ALFWorld 是确定性、离散 household 任务,长程噪声结构与数学推理 RLVR 差异大,应在多轮工具调用、代码生成、网页 agent 等环境上验证。(4) 学习率可移植性差:最优 $\eta_{\text{muon}}$ 随估计器翻转(GiGPO 偏 $3\times10^{-5}$、GraphGPO 偏 $10^{-5}$),建议提供 RMS 匹配(如 Moonlight 变体)以统一 AdamW 速率,降低调参成本。(5) 单 seed 主对比:核心结论在更多 seed 与跨任务前应谨慎引用。

未来方向

作者明确提出的方向:测量策略梯度/更新矩阵的有效秩与谱,直接检验 SNR 猜想;在更多 seed、模型、环境下验证 GiGPO 模式是否稳定复现;开发分布式 Muon 以支持更大模型,绕开 NO_SHARD 显存瓶颈;把优势估计器设计与优化器侧谱补救(Pion 高通滤波、Hopper 方差归一化+单步 NS)作为两条互补路线联合探索。基于本文成果可延伸:把 SNR 框架推广到其他谱敏感优化器(Lion-K 类、MuonClip 的 QK-clip);研究 step 信用与 Muon 的交互是否存在协同上限(AUC 差随 $\omega$ 单调还是先增后减);将 anchor-state 信用机制与基于潜势的 reward shaping(GraphGPO 的距离势)在统一基准上比较;探索自适应 Muon 学习率(按估计器在线估计梯度 SNR 调档),以解决当前“最优速率随估计器翻转”的实践痛点。

复现评估

复现性中等偏上。附录 A(Table 4)给出完整配置:Qwen2.5-0.5B-Instruct、ALFWorld、200 update、group 8/batch 16/验证 128、8×NVIDIA H20;Muon 动量 0.95/Nesterov/5 步 NS/weight decay 0.01/KL 系数 0.01;估计器特有设置(GiGPO $\gamma=0.95$、$\omega=1$;GraphGPO 距离衰减 $\gamma=0.10$、step/episode 权重 1/1)齐备。实现栈明确:PyTorch 2.11 + CUDA 13 + veRL 0.3 + vLLM 0.22,基于开源 verl-agent。但未提供代码/配置仓库链接,NO_SHARD 全矩阵实现要求较高单卡显存、8×H20 算力门槛不低;seed 信息有限(GraphGPO 仅 seed 0 与 2),且作者自报 $10^{-5}$ Muon 重跑从 0.901 掉到 0.848,方差较大,独立复现需做多种子平均。