论文
光谱靶向μ介子
Spectrally Targeted Muon
摘要
Muon 优化器对每个更新矩阵进行正交化,将其所有奇异值设置为 1,并且已被证明对于训练大型语言模型非常有效。然而,目前尚不清楚这种成功是来自放大梯度下降忽略的小奇异方向,还是来自抑制破坏训练的大的退化方向。我们引入了光谱目标 Muon,它仅对高于或低于阈值 $τ$ 的奇异值进行正交化,以便在标准化 SGD 和 Muon 之间插入不同的 $τ$。它通过在移位 Gram 矩阵上通过 Newton-Schulz 迭代计算的投影来隔离相关的奇异子空间,因此不需要 SVD。我们在 CIFAR-10 和 NanoGPT speedruns 上评估这些变体,跟踪梯度、更新和权重矩阵的有效等级以及新的度量,即更新与权重矩阵等谱流形的切线空间的对齐。我们发现三件事。首先,动量的小奇异值不是噪声。除了每个最大的奇异值之外,对所有内容进行正交化 矩阵几乎与 Muon 匹配,但只触及一小部分动量,而仅对顶部进行正交化则远远不够,尽管它保留了几乎所有的动量。在语言模型上,每个动量奇异值都远低于 1,因此有针对性的正交化只能放大,而 Muon 通过使太小而无法在原始规模上训练的方向变得可训练而获胜。其次,缩小最大奇异值可以保持参数谱平坦;这很便宜,而且并不是造成损失的原因。第三,AdamW 与 Muon 的不同之处主要在于它构建结构的速度有多慢,这解释了它的启动速度较慢以及为什么预热有助于 AdamW 但只会伤害 Muon。