论文

重新思考预训练之外的 Muon:VLA 和 RLVR 的光谱故障和高通补救措施

Rethinking Muon Beyond Pretraining: Spectral Failures and High-Pass Remedies for VLA and RLVR

模型训练强化学习

摘要

Muon 是一种矩阵感知优化器,它利用 Newton-Schulz (NS) 迭代,通过将动量矩阵的所有奇异值驱动到 1 来强制谱梯度正交化。虽然这种均匀谱白化增强了探索,并且在 LLM 预训练中优于 AdamW,但我们表明,它可能会导致两种机制中预训练之外的基本限制:(i) 跨模态视觉-语言-动作 (VLA) 训练,本质上,其中低秩动作模块梯度会导致噪声尾部方向的放大,以及(ii)具有可验证奖励的强化学习(RLVR),其中低SNR梯度和需要保留先前训练中的每个头的专业化使得白化不稳定。为了应对这些挑战,我们提出了 Pion,它是 Muon 的直接替代品,可以保留其计算效率,同时用两阶段提升+抑制机制(我们称之为高通 NS 迭代)取代均匀光谱白化。这种设计会产生尖锐的频谱高通效应,将主要奇异值锚定为 1,同时将噪声尾部分量抑制为 0,并且滤波器强度可控。为了保持预训练的每头异质性,Pion 还支持每头模式,通过简单的重塑在注意力头上独立应用更新,无需额外成本。在 LIBERO 和 LIBERO-Plus 上的 VLA 训练中,Pion 始终优于 l_1 回归 (VLA-Adapter) 和流匹配 (VLANeXt) 架构的基线,例如,使用 VLA-Adapter 进行 1,500 个训练步骤后,LIBERO 对象上的成功率达到 100%,而 Muon 为 97.0%,AdamW 仅为 32.2%。 Pion 的优势进一步扩展到真正的 Franka Research 3 机器人,该机器人在 DROID 设置下具有 pi_0.5 主干网,可完成三个抓取和放置任务。在具有 GRPO 和 GMPO 的 Qwen3-1.7B/4B 上的 RLVR 后训练 中,Pion 在 MATH 和 GSM8K 上的表现也优于 AdamW,而 Muon 则崩溃到零。