论文

LLM 训练学习率缩放的非线性

On the Nonlinearity of Learning Rate Scaling for LLM Training

模型训练预训练

摘要

学习率迁移可以降低训练 大语言模型 的成本:实践者不是在目标规模上扫除学习率,而是从较小的运行中推断。现有方法通常假设最佳学习率遵循数据规模和模型大小的对数线性缩放定律。我们仔细检查和评估这个比例定律。在我们对 GPT-2 型模型(在 5B 到 100B 词元上训练的 22M 到 707M 参数)的实证研究中,最佳学习率在更大的尺度上出现向上弯曲,导致外推不准确。我们发现,当学习率被有效学习率(归一化权重空间中的步长)替代时,并且当使用数据$D$外推而不是模型大小$N$外推时,这种曲率很大程度上消失。接下来,我们解释缩放中的非线性:当最优学习很小时,权重范数收敛到平衡的速度较慢,需要更大的步长来减少瞬态阶段。 AdamH 直接控制有效学习率的实验进一步支持了这一解释。