论文

Muon$^2$:通过自适应二阶矩预处理增强 Muon

Muon$^2$: Boosting Muon via Adaptive Second-Moment Preconditioning

模型训练预训练

摘要

Muon 通过迭代正交化利用神经网络更新的矩阵结构,已成为大规模基础模型 预训练 的有前途的优化器。然而,Muon 的正交化质量取决于执行的牛顿-舒尔茨 (NS) 迭代的次数,这由于其不平凡的计算和通信成本而带来了效率挑战。我们提出 Muon$^2$(Muon 的扩展),通过在正交化之前应用 Adam 式自适应二阶矩预处理来提高质量和效率。我们的主要见解是,Muon 极坐标逼近的核心挑战在于病态动量矩阵,Muon$^2$ 大大改善了该矩阵的频谱,从而更快地收敛到实际上足够的正交化。我们通过定向排列进一步表征了实际的正交化质量,在这种情况下,Muon$^2$ 在每个极性步骤上都比 Muon 表现出显着的改进。在高达 13B 个参数的 GPT、LLaMA 和 Mixture-of-Experts 预训练 实验中,Muon$^2$(及其保留大部分优点的内存高效变体 Muon$^2$-F)始终优于 Muon 及其变体,同时减少 40% 的 NS 迭代,并且在实现相同损失时比 Muon 节省高达 1/4 的训练时间。