论文

具有低秩适配器的近似 Muon

Approximate Muon with low-rank adapters

模型训练参数高效训练

摘要

在预训练神经网络时,Muon 优化器与替代方案相比显示出明显的优势。然而,对于参数高效的 微调 (PEFT),它的使用频率较低。一个潜在的原因是,最常见的 PEFT 方法 LoRA 不能自然地与 Muon 结合,因为在数学上不可能对低秩参数化给出的权重更新进行正交化。在本文中,我们通过线性化和最小二乘法在低秩设置中逼近松弛 Muon 目标的解来解决这个问题。我们提供了一种仅使用 matmul 运算的高效实现,而不是更复杂的线性代数分解例程。我们的方法 sMuon(小 Muon)在 SFT 和 ReLoRA 预训练实验中表现良好。虽然结果取决于模型和评估,但我们发现总体而言,使用 Muon 进行低秩 微调 可以提供适度的性能改进。