论文

用于扩展过度训练轴的优化器内存计划

Optimizer Memory Schedules for Outscaling the Overtraining Axis

模型训练预训练

摘要

我们研究了优化器如何在过度训练轴上扩展,并表明相对优化器性能和最佳超参数随着训练范围的变化而发生很大变化。特别是,我们研究了矩阵预处理方法(Muon 和 SOAP)和动量调度方法 (ADANA) 相对于 AdamW 的规模如何。我们在 51M 到 253M 参数的模型和 1x 到 256x 的过度训练 (OT) 因子之间比较这四个优化器,在每个设置下扫描基础学习率。首选学习率计划可以在过度训练轴上逆转,最佳权重衰减系数大约为 sqrt(OT),较长的视野通常有利于较长的固定记忆。在每个层面分别调整 AdamW 的固定内存后,ADANA 相对于 AdamW 的扩展优势仍然存在。对数时间的体重衰减和动量冷却为 ADANA 带来了巨大的收益,并且随着训练的增加而增加。通过这种处理,ADANA 的指数优势超过了 AdamW,接近 DANA 幂律随机特征理论所预测的优势。相反,在大多数测量范围内,Muon 和 SOAP 比 AdamW 提供了大致恒定的词元效率优势,尽管 SOAP 在最高过度训练因子下可能会进一步获得优势。 ADANA 一开始落后于两个矩阵预处理优化器,但随着训练的增加,差距逐渐缩小,超越了 Muon,并在最高 OT 系数下与 SOAP 竞争。这些结果将训练范围确立为优化器评估和设计的重要轴。