论文

RODE:用于优化的径向正交解耦引擎

RODE: A Radial-Orthogonal Decoupled Engine for Optimization

模型训练预训练

摘要

现代神经网络训练越来越多地使用矩阵感知优化器,但它们的条件矩阵步骤通常直接添加到权重中,共同改变其范数和方向。这种相互作用很重要,因为当前的范数决定了角运动,而定向学习可以驱动范数的增长,从而改变后续的步骤。我们引入了 RODE,它为径向和方向分量提供了单独的更新规则和步长。 RODE 通过标量径向规则显式更新矩阵 Frobenius 范数,而其方向通道在切线空间中执行 Newton-Schulz 条件更新。受控 GPT-2 干预显示了直接规范控制和 RODE 定向更新的收益。在两个语言建模和两个图像分类任务中,RODE 在每次直接比较中都优于两个 Muon 变体,并以较低的全模型规范结束。在 1.5B 尺度上,使用直接从 Qwen2 式 LM 扫描转移的学习率,相对于 Muon RMS,RODE 将损失从 4.145 降低到 3.346,最终全局范数从 11964 降低到 2183,固定半径 RODE 进一步改进。对于Qwen3.5-9B全参数微调,所有六个优化器都使用相同的调优预算和相同的正式训练和评估设置; RODE 在所有四项评估任务上均优于两种 Muon 变体,并在 GSM8K 和 MATH-500 上达到最高平均值。因此,解耦径向和方向动力学为矩阵优化提供了一种更有效、更可控的方法。