论文
MGUP:随机优化的动量梯度对齐更新策略
MGUP: A Momentum-Gradient Alignment Update Policy for Stochastic Optimization
摘要
高效的优化对于训练 大语言模型 至关重要。尽管已经探索了层内选择性更新,但仍然缺乏一种能够在确保收敛保证的同时实现细粒度控制的通用机制。为了弥补这一差距,我们提出了 \textbf{MGUP},一种选择性更新的新颖机制。 \textbf{MGUP} 通过在每次迭代中对选定的固定比例参数应用较大的步长,同时对其余参数应用较小的非零步长,增强了标准的基于动量的优化器。作为一个近乎即插即用的模块,\textbf{MGUP} 与 AdamW、Lion 和 Muon 等优化器无缝集成。这会产生强大的变体,例如 \textbf{MGUP-AdamW}、\textbf{MGUP-Lion} 和 \textbf{MGUP-Muon}。在标准假设下,我们为随机优化中的 \textbf{MGUP-AdamW} (无权重衰减)提供理论收敛保证。跨不同任务(包括 MAE 预训练、LLM 预训练和下游 微调)的广泛实验表明,与原始基础优化器相比,我们的 \textbf{MGUP} 增强优化器实现了更出色或更稳定的性能。我们提供有原则的、通用的、有理论依据的策略,用于高效的层内选择性更新,加速和稳定大规模模型的训练。该代码可在 https://github.com/MaeChd/MGUP 上公开获取。