论文
通过解耦权重向量的大小和方向来改进神经网络训练
Improving Neural Network Training by Decoupling the Magnitude and Direction of Weight Vectors
摘要
现代神经网络训练依赖于 Adam 和 Muon 等优化器,它们将每个权重矩阵作为单个对象起作用。然而,每个权重矩阵都带有两个不同的量——\emph{magnitude}和\emph{direction}——并且矩阵中的所有优化器作为一个整体耦合它们的动态:更新的方向变化取决于当前的幅度,而幅度作为学习方向的副产品而漂移。那么,两者都不受学习率的直接控制。因此,典型的训练依赖于周围的方法,例如权重衰减和热身,以保持学习规模的稳定,尽管这些只是间接调节耦合。其他最近的方法反而将权重限制在固定范数范围内,但不添加可学习的幅度,仅将尺度控制留给归一化层。我们提出 \emph{Magnitude--Direction (MD) Decoupling},一种优化器修改,将每个权重分解为超球面上的固定范数方向以及可学习的每行和每列幅度增益,以单独的学习速率更新,同时模型仍然看到单个融合权重张量。该方法与基础优化器无关,并且不需要权重衰减和预热。在 Adam 和 Muon 中,MD 解耦改进了经过良好调整的基线,无需重新调整即可在模型宽度上传输最佳 LR,并继续在大型专家混合 (MoE) 模型上提供大规模帮助。将幅度和方向视为单独控制的量,从而产生更可预测的训练动态以及对现代优化器的简单、广泛适用的改进。