论文

随学习率缩放权重衰减,改善模型训练

Scale Weight Decay and Train Better

模型训练预训练

摘要

缩放法则推动神经网络使用越来越多的数据训练,但常用的恒定解耦权重衰减会让权重在训练中持续收缩。受 Robbins–Monro 条件启发,论文提出按当前学习率与峰值学习率之比 η/ηmax 缩放权重衰减,并证明该方法对随机梯度下降和非欧几里得谱优化器 Muon 保留对应无正则化方法的渐近平稳性保证,避免恒定解耦衰减引入的额外渐近偏差。它保留权重衰减的稳定性益处,而不改变渐近优化目标。稳态分析解释了标准衰减下权重范数持续缩小,而缩放衰减下其趋于近似常数。在 7200 万至 9.3 亿参数的 MoE 模型、每个激活参数约 600 个训练词元的实验中,Muon-SW 持续优于相同超参数的 Muon,在最大规模下达到相同验证损失的训练时间缩短 30%。作者认为若这一趋势在更大规模上保持,可用少量代码加速前沿模型预训练。