论文
MiMuon:具有改进的大型模型泛化能力的混合 Muon 优化器
MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models
摘要
矩阵结构参数频繁出现在大语言模型等许多人工智能模型中。最近,针对大型模型的矩阵参数设计了一种高效的 Muon 优化器,并且显示出比向量算法明显更快的收敛速度。尽管一些工作已经开始研究Muon优化器的收敛特性(即优化误差),但其泛化特性(即泛化误差)仍然没有建立。因此,本文基于算法稳定性和数学归纳法研究了Muon优化器的泛化误差,并证明了Muon优化器的泛化误差为$O\big(\frac{1}{Nκ^{T}}\big)$,其中$N$为训练样本大小,$T$表示迭代次数,$κ>0$表示梯度估计奇异值之间的最小差值。为了增强 Muon 的泛化能力,我们通过谨慎使用梯度正交化提出了一种有效的混合 Muon (MiMuon) 优化器,它是 Muon 和基于动量的 SGD 优化器的混合。然后我们证明我们的 MiMuon 优化器的泛化误差 $O\big(\frac{1}{N}\big)$ 比 Muon 优化器的 $O\big(\frac{1}{Nκ^{T}}\big)$ 更低,因为 $κ$ 通常非常小。同时,我们还研究了MiMuon算法的收敛特性,并证明我们的MiMuon算法具有与Muon算法相同的$O(\frac{1}{T^{1/4}})$收敛速度。训练包括 Qwen3-0.6B 和 YOLO26m 在内的大型模型的一些数值实验结果证明了 MiMuon 优化器的效率。