论文

神奇的预训练优化器以及在哪里可以找到它们 II:Hyperball 优化

Fantastic Pretraining Optimizers and Where to Find Them II: Hyperball Optimization

模型训练预训练

摘要

基于矩阵的优化器(例如 Muon)可以大大加快语言模型预训练的速度,但在使用标准常数解耦权重衰减时,随着模型大小和数据规模的增长,观察到它们相对 AdamW 的增益会缩小。我们提出了 Hyperball,一个简单的优化器包装器来解决这个问题。给定一个基本优化器,例如 Adam 或 Muon,Hyperball 将权重矩阵的 Frobenius 范数及其相应的优化器更新设置为固定常数。在参数高达 1.2B 的 Qwen3 风格模型上,Muon Hyperball 比权重衰减基线实现了 20--30% 的词元等效加速。与解耦权重衰减相比,Hyperball 还提高了跨宽度和深度的学习率传递。该方法的动机是先前的理论表明,权重衰减训练会导致仅取决于训练超参数的平衡权重范数。通过这种机制,权重衰减决定了角度学习率,即权重矩阵方向变化的速度。