论文
Muon何时有助于代理强化学习?
When Does Muon Help Agentic Reinforcement Learning?
摘要
Muon 在大规模 预训练 中与 AdamW 具有竞争力,但其在强化学习 后训练 中的运行机制仍不清楚。我们使用三个基于组的目标和从 0.5B 到 3B 的 Qwen2.5 模型将这一机制映射到 ALFWorld(一个稀疏奖励代理基准)上。在共享 KL 和裁剪配方下,匹配的优化器比较和 AdamW 速率控制跟踪可用的步长范围。 AdamW 对速率做出非单调响应,而扇入 Muon 在更积极的有效步骤中保持稳定:在速率度量测试校正后,在 $3 \times 10^{-5}$ 下,它比 AdamW $10^{-6}$ 基线提高了后期成功率。其归一化 AUC 效应是方向性正的,但不太均匀;启发式匹配的低速率效果不太一致,并且调整后的 AdamW 在 3B GraphGPO 上几乎匹配高速率 Muon。高速率 Muon 应用 $3.53 \times$ AdamW 的隐藏矩阵更新 RMS;全预算 RMS 匹配控制消除了后期成功增益。总之,这些结果确定了一个配方级操作机制,其中扇入 Muon 在共享 KL 和限幅下支持更积极的稳定有效步骤:在 AdamW 调整后或在幅度匹配下,当优化余量保持并收缩到接近饱和时,裕度最大。比例匹配控制将这种光谱效应与 Muon 的比例约定联系起来,而不是建立通用优化器排名。代码可在 https://github.com/x66ccff/verl-muon 获取。