论文
有限次Newton–Schulz迭代的Muon:非光滑非凸优化中的平滑收益
Muon with Finite Newton-Schulz: The Smoothing Benefit in Nonsmooth Nonconvex Optimization
摘要
Muon已成为大语言模型预训练中矩阵参数的有力优化器,通过少量Newton–Schulz迭代近似正交化动量。已有理论常用精确极分解因子替代迭代,或把有限迭代深度视为误差,从而认为实际迭代只会损害保证。本文证明有限次迭代也能有利于非光滑非凸优化。分析采用从在线学习到非凸优化的转换,将更新规则视为在线学习器,再把遗憾界转为驻点保证。有限次Newton–Schulz迭代把不连续的极分解映射平滑为关于奇异值的Lipschitz映射,Muon可视为带平滑谱势函数的在线学习器。该平滑性质正是转换所需:迭代深度仅随目标精度对数增长,就足以保证向非光滑非凸优化驻点收敛,精确极分解更新却可能失败。样本复杂度达到非光滑非凸优化的已知最优保证,在光滑非凸优化中除依赖问题的因子外也是最优。证明还适用于具有相同平滑性质的一般谱映射。