论文
Muon 中的行归一化难题
The Row Normalization Puzzle in Muon
摘要
本文研究了行重整化如何影响 Muon,重点关注 NorMuon 最坏情况保证与其实际性能之间的差距(Li 等人)。尽管 NorMuon 的采用率不断提高,并且在大语言模型 (LLM) 预训练中的性能前景看好,但 NorMuon 的最坏情况保证仍然知之甚少。一个基本问题是:行归一化是否可能通过其与近似极分解计算和指数移动平均动量的相互作用产生可证明的收敛增益?我们的结果表明,行归一化在算子范数几何下的最坏情况迭代复杂性中引入了一个与维度相关的因素,即使使用精确的极分解计算和任何固定的动量参数,该因素仍然存在。事实上,我们在确定性设置中建立了一个依赖于算法的下界和一个匹配的上限,并将我们的上限分析扩展到随机设置。两种上限分析都允许近似极分解计算。实验表明,NorMuon 在受我们最坏情况构造启发的合成问题上比 Muon 慢,但在 LLM 预训练中优于 Muon。这些发现加深了行标准化为何在实践中有所帮助的谜题,并补充了 Dewulf 等人的最新发现。