Muon优化器在智能体强化学习中何时有效? 📅 2026/7/20 10:12:56 Muon优化器在智能体强化学习中何时有效arXiv:2607.16169v1 [cs.LG] 2026-07-17开源协议CC BY 4.0摘要Muon优化器在大模型预训练场景性能可媲美AdamW但在LLM智能体强化学习RL后微调中的适用边界尚不清晰。本文基于ALFWorld环境、Qwen2.5-0.5B-Instruct模型采用单种子对照实验系统对比Muon与AdamW在分组式强化学习框架下的效果。核心实验结论仅对网络隐藏权重使用Muon、其余层保留AdamW的配置在GiGPO算法下验证集最终平均任务成功率从0.290提升至0.546相对提升88%同等高学习率下AdamW会完全丢失验证集任务效果。Muon收益强弱与优势估计器、学习率高度相关GRPO框架Muon3e-5将最终成功率从0.161提升至0.268GraphGPO框架低学习率1e-5下Muon归一化AUC从0.399提升至0.556能提前30/60轮达到0.5、0.75成功率阈值。机制层面猜想Muon通过谱归一化放大梯度弱奇异方向而精细时序优势估计分步信用分配可降低梯度噪声、提升弱方向信号可靠性二者形成增益互补。本文完整复现了GiGPO/GRPO/GraphGPO三类分组RL训练流程、消融实验与超参配置为后续优化器优势估计器联合调优提供完整实证依据。关键词Muon优化器强化学习LLM智能体信用分配GRPOGiGPOGraphGPO谱归一化1 引言Muon优化器核心设计采用牛顿-舒尔茨Newton–Schulz迭代对动量矩阵近似谱归一化替代Adam系列逐元素自适应缩放。十亿参数预训练中Muon可在匹配损失前提下仅消耗AdamW约52%算力万亿规模预训练已落地使用。但Muon作者明确提出开放问题Muon能否迁移至强化学习后微调现有研究结论相互矛盾NVIDIA NeMo仅报告RL微调中Muon小幅提升跨优化器微调研究表明Adam预训练模型直接全量Muon微调会出现严重遗忘学习率越高越明显近期RLVR单轮数学推理实验指出Muon会放大噪声梯度导致训练崩溃。现有负面结论均基于单轮问答、仅回合级全局优势的RLVR任务本文聚焦长时序稀疏奖励具身智能体引入GiGPO、GraphGPO两类带分步信用分配的分组RL算法对比Muon效果差异核心创新严格控制变量的单种子对照实验对比Muon/AdamW在GRPO/GiGPO/GraphGPO三类时序信用分配框架性能高学习率AdamW对照组验证Muon增益并非单纯更大步长带来分步信用分配消融实验证明精细时序估计与Muon谱均衡机制互补梯度信噪比SNR机制猜想统一解释现有正负实验结果。核心观测GiGPO含锚态分步信用场景Muon增益最大AdamW高学习率训练全程无有效任务成功率仅回合级GRPO收益有限GraphGPO后期性能趋于饱和但Muon可加速收敛。2 相关工作2.1 Muon与矩阵感知优化器Muon仅对2D权重矩阵Attention、MLP执行动量谱正交化嵌入层、归一化层、输出头沿用AdamW。同类衍生优化器MuonClipQK裁剪稳定万亿预训练针对预训练注意力爆炸不适用RL场景Pion高通滤波抑制梯度弱噪声奇异方向与本文“固定Muon、更换RL信用分配”正交Lion-K系列Muon等价核范数变体但无法预测RL场景表现。Muon核心特性仅保留动量矩阵奇异方向符号丢弃幅值同等放大强弱梯度方向。2.2 跨优化器微调与RL下Muon表现监督微调场景Adam预训练模型使用Muon全量微调会严重遗忘学习率越高衰减越剧烈RLVR单轮任务Muon谱均衡放大低信噪比噪声梯度训练熵地板、梯度爆炸工业预训练-RL流水线Kimi、INTELLECT-3采用Muon预训练Muon微调无跨优化器冲突但缺少时序智能体评测。现有研究均未区分回合级全局信用与分步时序信用对Muon效果的影响本文填补该空白。2.3 LLM分组强化学习分组RL核心同提示多条轨迹组内归一化回报降低方差。GRPO仅单回合全局回报计算优势无分步时序信用GiGPO复用重复锚定状态增加分步相对优势项可开关分步权重ω退化为标准GRPOGraphGPO将轨迹聚合为状态转移图基于到目标距离分配边级时序信用长时序误差更低。三类算法覆盖从粗到细三种信用分配粒度是本文完整对照基础。3 预备知识3.1 任务环境设置LLM智能体与环境多步交互每步观测状态sts_tst输出文本动作ata_tat仅任务完成时给予稀疏正奖励无效动作施加小额惩罚ALFWorld居家具身环境单轨迹最长50步。3.2 GiGPO 分组内分组策略优化每条轨迹总回报R(τi)R(\tau_i)R(τi)组内归一化得到回合级优势AE(τi)R(τi)−mean({R(τj)}j1N)Fnorm({R(τj)}j1N)A^{E}(\tau_{i})\frac{R(\tau_{i})-\mathrm{mean}(\{R(\tau_{j})\}_{j1}^{N})}{F_{\mathrm{norm}}(\{R(\tau_{j})\}_{j1}^{N})}AE(τi)Fnorm({R(τj)}j1N)R(τi)−mean({R(τj)}j1N)FnormF_{\mathrm{norm}}Fnorm为组内标准差归一化因子。利用多条轨迹重复访问锚定状态s~\tilde{s}s~对同状态下动作折现回报分组归一化得到分步优势AS(at(i))A^S(a_t^{(i)})AS(at(i))综合总优势A(at(i))AE(τi)ω AS(at(i))A(a_t^{(i)})A^{E}(\tau_{i})\omega\,A^{S}(a_{t}^{(i)})A(at(i))AE(τi)ωAS(at(i))ω0\omega0ω0时等价原生GRPO代码完全复用仅切换分步权重消除实现差异干扰。训练采用带KL约束的PPO裁剪损失。3.3 Muon优化规则对动量累积矩阵MMM执行5次牛顿-舒尔茨迭代近似极分解NS5(M)≈UV⊤\mathrm{NS}_5(M)\approx UV^\topNS5(M)≈UV⊤更新ΔW∝NS5(M)\Delta W \propto \mathrm{NS}_5(M)ΔW∝NS5(M)仅2D权重矩阵Attention/MLP使用Muon嵌入、LN、输出层绑定Qwen共享权重统一采用AdamW。超参动量0.95开启Nesterov。3.4 学习率可比性说明Mu与AdamW学习率无直接换算关系矩阵尺寸不同缩放规则存在差异。通用经验同等效果Mu学习率约为Adam的10倍本文不对学习率做统一换算各组独立网格搜索最优步长。4 方法适配分组智能体RL的Muon配置4.1 标准对照实验配置基线全部参数使用AdamWlr1e-6Muon实验组仅替换隐藏2D矩阵优化器其余层保持基线AdamW不变矩阵层Muonηmuon3×10−5\eta_{\mathrm{muon}}3\times 10^{-5}ηmuon3×10−5嵌入/归一化/输出AdamWlr1e-6与基线完全一致分布式限制实验使用FSDP无分片NO_SHARD模式完整矩阵送入NS迭代代价是单卡显存占用提升大模型需分布式Muon实现。4.2 梯度信噪比猜想核心机制假设单层采样梯度拆解为真实信号G∗G^*G∗噪声误差EEEG^∑tA^t∇Wlogπθ(at∣st)G⋆E\widehat{G}\sum_{t}\widehat{A}_{t}\nabla_{W}\log\pi_{\theta}(a_{t}\mid s_{t})G^{\star}EGt∑At∇Wlogπθ(at∣st)G⋆E长时序任务中有效决策仅占少量步数K≪TK\ll TK≪T纯回合估计噪声远高于分步锚态估计信噪比满足近似比例SNRlocalSNRepisode≈TK\frac{\mathrm{SNR}_{\mathrm{local}}}{\mathrm{SNR}_{\mathrm{episode}}}\approx\frac{T}{K}SNRepisodeSNRlocal≈KTMuon对奇异方向做等幅值缩放若弱方向信号信噪比高则收益巨大分步信用分配GiGPO/GraphGPO过滤大量无关时序噪声提升弱梯度方向信号可靠度因此与Muon增益叠加。理想极分解期望内积信号对齐度量E⟨P(G^),G⋆⟩F∑isi[2Φ(si/σi)−1]\mathbb{E}\langle\mathcal{P}(\widehat{G}),G^{\star}\rangle_{F}\sum_{i}s_{i}\left[2\Phi(s_{i}/\sigma_{i})-1\right]E⟨P(G),G⋆⟩Fi∑si[2Φ(si/σi)−1]Φ\PhiΦ为标准正态分布累积函数sis_isi为奇异值信号幅值σi\sigma_iσi噪声标准差。仅当si/σis_i/\sigma_isi/σi足够大时Muon保留的符号方向能对齐真实梯度这解释为何纯GRPO收益有限、GiGPO提升显著。5 实验部分5.1 实验基础配置环境与模型环境ALFWorld居家具身智能6类任务拾取/查看/清洁/加热/冷藏/双拾取最长50步稀疏终点奖励基座模型Qwen2.5-0.5B-Instruct训练框架veRL-agentLLM智能体RL框架vLLM加速采样硬件8张NVIDIA H20总训练迭代200轮训练参数每组8条轨迹批次16任务每5轮执行一次128条episode验证评测指标窗口平均成功率最后25轮175~200均值归一化AUC0~200轮梯形积分表征全程学习效率收敛轮次达到0.5、0.75成功率的迭代步数。对照实验组基线AdamWlr1e-6Muon主组矩阵层Muon(3e-5)其余AdamW(1e-6)AdamW高学习率对照组lr1e-5、3e-5验证增益非大步长导致三类RL算法完整对照GRPO / GiGPO(ω0/1) / GraphGPOMuon双学习率消融1e-5、3e-5。5.2 主实验全局结果算法Muon学习率AdamW窗口均值Muon窗口均值成功率提升ΔAUC提升ΔGRPO3e-50.1610.2680.1070.013GiGPO1e-50.2900.5090.2190.147GiGPO3e-50.2900.5460.2550.127GraphGPO1e-50.8100.9010.0910.157GraphGPO3e-50.8100.8280.0180.076核心结论GiGPO分步信用场景Muon增益最大相对AdamW提升88%GRPO仅全局回合收益小幅提升GraphGPO低学习率Muon大幅加速收敛高学习率后期趋于饱和增益缩小。GiGPO高学习率AdamW控制实验优化器学习率最终成功率训练现象AdamW1e-60.320正常收敛AdamW1e-50.0005轮后完全失效KL剧烈震荡、动作格式崩溃AdamW3e-50.000全程无有效样本Muon3e-50.633稳定提升熵与基线接近同等名义大步长下AdamW训练崩溃证明Muon提升来源于谱归一化机制而非单纯更大更新步幅。5.3 分步信用ω消融实验GiGPO分步权重ωAdamW窗口均值Muon窗口均值Muon增益0纯GRPO0.1410.3610.2201完整分步信用0.2900.5460.255无论是否启用分步优势Muon均稳定优于AdamW同时分步信用能同步提升两类优化器性能二者具备协同增益。5.4 分任务表现GiGPOMuon在加热、双拾取、清洁任务提升幅度最高GRPO仅清洁、拾取收益明显查看任务AdamW略优GraphGPO全任务均衡提升证明Muon增益不存在任务偏置。5.5 训练动态分析GiGPOMuon策略更新幅度更大全程有效样本不中断GraphGPO低lr Muon前期学习速度显著更快高lr Muon后期饱和GRPO全程差距小仅训练后半段拉开成功率。6 讨论统一正负实验结论现有文献负面结果Muon训练崩溃均基于单轮、仅回合全局优势RLVR梯度信噪比极低Muon放大噪声方向本文长时序多步智能体引入分步/图结构信用分配过滤大量无关时序梯度噪声提升弱方向信号可靠度Muon谱均衡缩放产生正向增益。两条可行优化路线优化器侧Hopper、Pion等改良Muon抑制噪声奇异方向RL算法侧GiGPO/GraphGPO精细时序信用分配提升梯度信噪比。两类方案可组合叠加进一步提升训练效果。7 局限性仅单种子实验无多随机种子统计显著性仅Qwen2.5-0.5B、ALFWorld单环境泛化性待验证学习率网格搜索范围有限未做完整遍历未直接测量梯度奇异谱、梯度SNR机制仅为猜想无直接量化证据NO_SHARD无分片Muon显存开销巨大大模型分布式方案待开发。8 结论Muon在LLM智能体强化学习中的效果高度依赖优势估计器信用分配粒度GiGPO锚态分步信用场景提升最显著3e-5 Muon使窗口平均任务成功率相对AdamW提升88%同等高学习率AdamW训练完全失效GRPO仅全局回合优势时Muon收益微弱GraphGPO低学习率Muon可大幅加速收敛但训练后期性能饱和增益收窄分步信用分配与Muon谱归一化机制形成互补二者组合效果最优。实验证明优化器与RL时序信用分配需要联合调优后续可拓展多模型、多环境、多种子大规模对照实验验证本文猜想。附录A 完整训练超参全局共享配置参数取值基座模型Qwen2.5-0.5B-Instruct环境ALFWorld具身智能总训练迭代200验证间隔每5轮单轨迹最大步数50每组轨迹数量8训练批次16任务验证批次128条episode最大提示长度2048最大回复长度512PPO小批次128PPO迭代轮数1采样温度训练/验证1.0 / 0.4硬件8×H20优化器与损失参数取值Muon配置仅2D矩阵层动量0.95Nesterov5次NS迭代AdamW基准学习率1e-6Muon学习率候选1e-5、3e-5权重衰减0.01KL损失系数0.01无效动作惩罚系数0.01各算法专属超参GRPOMuon固定3e-5无分步项GiGPO折扣γ0.95分步权重ω0/1GraphGPO距离衰减γ0.1图距离归一化关闭。附录B Muon实现与部署说明运行环境PyTorch 2.11 CUDA13 veRL 0.3 vLLM 0.22分片限制本实验Muon采用NO_SHARD无分片加载完整权重矩阵执行牛顿-舒尔茨迭代单卡显存占用大幅上升超大模型需要分布式Muon分片实现方案。附录C 补充诊断图表数据C.1 GiGPO逐轮验证成功率迭代轮AdamW(1e-6)Muon(3e-5)500.0470.0941000.1330.2111500.1640.4532000.3200.633最后6轮均值AdamW0.290Muon0.546C.2 ω0/1消融完整曲线关闭分步信用ω0Muon仍有明显提升开启分步信用后两类优化器同步上涨叠加增益。C.3 GRPO分任务诊断GRPO下Muon在清洁、双拾取、拾取任务提升最高查看任务AdamW小幅占优不存在全局统一增益。附录D 梯度信噪比机制完整推导D.1 长时序信用噪声推导假设轨迹总步数T有效决策K噪声项互不相关、方差均等回合估计噪声方差正比T精细局部估计正比K信噪比比值T/KT/KT/K。D.2 锚态信用消除混杂项同锚状态多条轨迹回报做组内均值抵消环境固有难度偏置降低噪声方差。D.3 GraphGPO势能式时序信用基于到目标距离构造时序差分信号回报分散至每一步避免终点单信号噪声集中。D.4 可验证预测精细信用分配GiGPO/GraphGPO下Muon增益显著高于纯GRPOMuon增益来源于弱奇异方向信噪比提升可通过梯度奇异谱量化验证本文未测量谱/信噪比仅为可测试理论猜想。附录E GiGPO高学习率AdamW诊断AdamW 1e-5/3e-5两组高学习率全程验证成功率为0训练后期KL损失剧烈震荡、生成文本长度饱和、大量无效动作Muon同等步长无此类崩溃现象。