论文

有效学习率控制语言模型预训练中的损失动态

Effective Learning Rate Governs Loss Dynamics in Language Model Pretraining

模型评测模型行为与机制分析

摘要

我们发现语言模型预训练中的 ELR 崩溃:学习率(LR)和参数范数主要通过它们的比率,即有效学习率(ELR)来控制损失动态。当 ELR 在运行中匹配时,尽管 LR 和参数规范存在显着不同,但它们的损失轨迹在整个训练过程中都会崩溃。在优化器、架构、数据集和模型规模中,平均崩溃误差通常为几个 x 10^-3,低于在代表性配置中测量的种子到种子的变化。系统消融将归一化设计和 LR 范数变化的时间尺度确定为塌陷精度的关键决定因素。受控干预进一步表明,体重衰减和 Hyperball 形状损失动态主要是通过它们诱导的 ELR 时间表实现的。用 ELR 替换 LR 可以使拟合的函数标度律 (FSL) 能够跨范数控制方法迁移。由此产生的基于 ELR 的 FSL 还解释了延迟加速,这是规范控制的反复出现的效果。总之,这些结果将 ELR 确立为连接 LR 调度、范数控制和损失动态的通用坐标。