论文
有限步Newton–Schulz正交化下Muon的训练损失保证
Training-Loss Guarantees for Muon with Finite-Step Newton--Schulz Orthogonalization
摘要
现有Muon收敛分析要么假设精确正交化,要么分析经典Newton–Schulz多项式,并且仅保证驻点,因此Muon的五步调参Newton–Schulz迭代保留了什么、是否足以达到指定神经网络训练损失,仍未解决。我们建立同时考虑正交化前动量累积和有限步调参更新的有限时间训练保证。对于固定随机输出权重且极限神经切线核正定的足够宽二层ReLU网络的全批量训练,我们证明Muon以相对于初始化的高概率达到任意目标经验平方损失ε>0。对每个动量参数μ∈[0,1),与(1−μ)√ε成正比、依赖目标的常数学习率,在其他问题参数固定时给出O((1−μ)⁻¹ε⁻¹ᐟ²)的到达时间界。充分宽度与目标准确度和动量均无关。分析表明,调参Newton–Schulz映射在约束更新谱范数的同时,保持与动量缓冲的对齐;初始化附近的梯度变化控制将这种对齐传递到当前梯度,无需精确正交化即可确保在达到目标前持续下降。数值实验在低于理论充分阈值的宽度下支持这些机制:梯度与更新的对齐保持在分析参照之上,固定师生数据集上的六种宽度、五个学生初始化,共30次运行全部达到目标损失并保持核正性。