论文
MONA:具有 Nesterov 加速功能的 Muon 优化器,适用于可扩展语言 模型训练
MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training
摘要
Muon 优化器最近为 大语言模型 训练提供了 AdamW 的有前途的替代方案,利用矩阵正交化来生成几何感知更新。然而,像所有一阶方法一样,μ 子可能会陷入尖锐的局部极小值。在这项工作中,我们提出了 MONA,这是一种将 Muon 正交化框架与曲率感知加速连接起来的优化器。 MONA 将加速项直接添加到 Muon 的梯度处理管道中。该项是根据梯度差的指数移动平均值计算得出的。我们为 MONA 提供了详细的收敛分析,表明加速项引入了曲率敏感校正,同时保留了 Muon 的谱范数正则化。根据经验,与 Muon 和 AdamW 相比,MONA 在专家混合预训练的三个规模(从 1B 到 68B 参数)上实现了更好的收敛和下游任务性能,最大的模型在 1 万亿个词元上进行了训练。此外,我们对 MOE-68B-A3B 模型进行有监督的 微调,并在一般能力、数学推理和代码生成基准上对其进行评估,其中 MONA 实现了 SOTA 性能。