论文

从河谷视角理解Muon优化器的能力与局限

Towards Understanding the Power and Limits of the Muon Optimizer: A River-Valley Perspective

模型训练预训练

摘要

Muon常被视为Adam类优化器的替代选择,谱归一化和条件改善理论强调其优势,但在LLM训练中相对Adam或AdamW的收益并不一致,也依赖调度。本文提出轨迹层面的理论,分析Muon的优势与限制。混合尖峰矩阵感知模型将感知算子分成信号、尖峰及主体成分,刻画类似LLM训练中的各向异性结构与长尾信息。河谷视角把优化地形分成朝向目标的河流方向,以及承载干扰或任务无关信息的山坡方向。无动量时,Muon沿有效信息方向的初期移动更快,但在谷底附近可能比梯度下降收敛慢得多。作者进一步分析带动量的一般非凸目标及谱河流上的点,发现正交化更新虽使初期更快,却丢弃残余尺度信息,易在目标附近超调和振荡。这些结果促使作者提出末阶段切换到梯度下降类精修优化器,而非仅依赖固定Muon学习率调度;语言模型训练实验提供了初步支持。