论文
Muon学事实更快的机制:谱正交化的作用
Muon Learns Facts Better: Understanding the Role of Spectral Orthogonalization
摘要
Muon优化器对矩阵值更新施加谱正交化,在大规模神经网络训练中表现强劲,但这一变换在特征学习中的机制仍不甚清楚。本文通过可处理的事实回忆模型研究该问题:事实把每个主-谓对映射到答案,线性transformer学习恢复该映射所需的主语相关与谓语相关信息。transformer分别用梯度流(GF)、谱GF与Sign GF优化——它们分别是梯度下降、Muon与Adam的连续时间极限。先前研究(Nichani等,2025)表明当主语数超过谓语数时,GF先学谓语相关信息再学主语相关信息,产生特征分离阶段。我们用主语/谓语相关分量达到目标准确率的学习时间刻画该分离:S个主语R个谓语下,GF的学习时间比为Θ̃(√(S/R)),而谱GF把它降为Θ̃(1);固定S与R时,GF下主谓误差按1/(T log T)衰减,谱GF下按exp(-poly(T))衰减。最后我们证明GF与谱GF对token嵌入的正交变换等变而Sign GF不等变:不同的正交嵌入可能产生无分离、大分离阶段甚至反向学习顺序。这些结果为谱正交化如何根本重塑特征学习动力学提供机制视角。