论文

Aurora:杠杆感知光谱优化器

Aurora: A Leverage-Aware Spectral Optimizer

模型训练预训练

摘要

我们表明,对于高矩阵参数,例如 MLP 层中的投影矩阵,Muon 更新可以具有任意不均匀的行范数。这可能会导致自我强化的反馈循环,神经元会持续接收较小的更新,最终不会对网络输出做出有意义的贡献。这个问题可以通过额外的行归一化步骤有效地缓解,但当前的方法以将 Muon 更新几何结构移离动量矩阵的极坐标因子的方式来实现这一点,我们发现这是不可取的。我们提出了 Aurora,一个优化器,它强制矩阵参数更新的行一致性,同时尊重 Muon 的极因子几何。在我们的 预训练 实验中,Aurora 的表现优于 Muon,并且与现有方法结合时,在 modded-nanoGPT speedrun 的优化器轨道上实现了光谱优化器中最先进的性能。此外,我们发现 Aurora 在 MLP 扩展因子下的经验增益超过了 Muon 尺度,这表明 Aurora 可能允许有效训练非常宽的 MLP 层。