论文
Muown:用于 Muon 优化的行范数控制
Muown: Row-Norm Control for Muon Optimization
摘要
Muon 已成为 AdamW 语言模型 预训练 的有力竞争对手,但其大规模行为对权重衰减很敏感。最近的研究发现,对于没有解耦权重衰减的 Muon,权重矩阵的谱范数在训练过程中向上漂移。通过将谱范数分解为行幅度因子和行相干因子,我们将前者确定为 Muon 下这种漂移的经验驱动因素,而后者沿着轨迹仍然表现良好。受此诊断的启发,我们引入了 Muown,它是 Muon 的直接替代品,它将行幅度向量视为显式优化器变量,在分解引起的 $\ell_\infty$ 几何下更新它,同时将 Muon 不变地应用于剩余的方向分量。我们证明 Muown 在与基础几何结构一致的双重范数下,在确定性和随机机制下都达到了最佳非凸率,并且随机噪声系数在整个训练过程中根据经验仍然低于 Muon 的随机噪声系数。在 FineWeb-Edu 上的 GPT 风格 预训练 中,模型大小从 124M 到 2.7B 参数,Muown 改善了 Muon、SOAP、AdamW 和 Lion 的困惑度。它还扩大了模型尺度上接近最佳学习率的平台,降低了对权重衰减的敏感度,并避免了适当分片时以可忽略的步长开销出现的谱范数漂移。