论文

MONA:具有 Nesterov 加速功能的 Muon 优化器,适用于可扩展语言 模型训练

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training

模型训练预训练

摘要

Muon 优化器最近为 大语言模型 训练提供了 AdamW 的有前途的替代方案,利用矩阵正交化来生成几何感知更新。然而,像所有一阶方法一样,μ 子可能会陷入尖锐的局部极小值。在这项工作中,我们提出了 MONA,这是一种将 Muon 正交化框架与曲率感知加速连接起来的优化器。 MONA 将加速项直接添加到 Muon 的梯度处理管道中。该项是根据梯度差的指数移动平均值计算得出的。我们为 MONA 提供了详细的收敛分析,表明加速项引入了曲率敏感校正,同时保留了 Muon 的谱范数正则化。根据经验,与 Muon 和 AdamW 相比,MONA 在专家混合预训练的三个规模(从 1B 到 68B 参数)上实现了更好的收敛和下游任务性能,最大的模型在 1 万亿个词元上进行了训练。此外,我们对 MOE-68B-A3B 模型进行有监督的 微调,并在一般能力、数学推理和代码生成基准上对其进行评估,其中 MONA 实现了 SOTA 性能。