论文

LionMuon:交替光谱和符号下降以实现高效训练

LionMuon: Alternating Spectral and Sign Descent for Efficient Training

模型训练预训练

摘要

在大规模优化中,更新步骤的廉价性和有效性是优化器成功的最关键因素。基于符号的优化器(例如 Lion 或 Signum)会产生廉价的每步更新,而 Muon 的谱矩阵符号更新以更高的每步成本提供更强的方向。在这项工作中,我们提出了 LionMuon,它保留了 Muon 步骤的有效性,同时大大降低了平均迭代成本,类似于基于符号的方法。它在固定周期 P 上交替进行 Lion 和 Muon 的更新,在它们之间共享单个双 EMA 动量缓冲区。因此,优化器状态内存与 Lion 匹配,并且正好是 AdamW 的一半。一种更简单的单 EMA 变体 SignMuon 本身就已经优于纯 Muon。在 P = 2 时,LionMuon Pareto 在我们以 124M 模型大小测试的每个数据集和架构上都优于 Muon、Lion、Signum 和 AdamW,以较低的计算量实现了较低的验证损失,并且在 355M 和 720M 规模下仍保持相同的优势。在理论方面,我们证明了重尾噪声下的尖锐复杂性界限,该噪声由周期平均平滑度和在 Muon 常数和 Lion 常数之间插值的噪声控制。这些界限预测了计算最佳时期以及 LionMuon 超过 Muon 和 Lion 的条件。代码:https://github.com/brain-lab-research/lion-muon