论文
Hyperball 可能不是免费的午餐
Hyperball May Not Be a Free Lunch
摘要
对于尺度不变的深度网络,Hyperball 式优化器通过固定矩阵值参数的范数和规范化更新,在大规模训练中表现出了强大的性能。然而,他们的优势来源仍不清楚。从连续参数状态之间的角位移开始,我们推导了考虑参数更新角度、参数范数和更新范数的角度有效学习率。我们还表明,传统的基于范数的度量是参数更新正交性下的特殊情况。然后,我们将优化器更新分解为径向和切向分量,并分析径向更新如何影响一步角位移。在所考虑的训练配置下,数值结果表明径向分量对角度有效学习率仅具有有限的直接影响。因此,它无法解释为什么 MuonH 在训练初期比 MuonWD 收敛得更慢,但后来又超过了它。为了进一步隔离底层机制,我们设计了一个启发式实验,仅修改学习率计划,以便每个优化器的动态重现另一个优化器的动态。结果表明,它们的主要差异源于有效步长的演变,而不是由 Hyperball 引起的本质上优越的更新方向。我们的预训练实验进一步表明,更积极的学习率衰减可以在训练早期加速 MuonH,但可能会损害其后期的性能。因此,保持恒定的角速度并不能消除学习率调度问题;仔细的调度对于实现 Hyperball 式优化器的潜力仍然至关重要。我们的代码可在 https://github.com/mangocrazz/hyperball-may-not-be-a-free-lunch 上公开获取。