论文

一个 LR 并不适合所有情况:LLM 的重尾引导分层学习率

One LR Doesn't Fit All: Heavy-Tail Guided Layerwise Learning Rates for LLMs

模型训练预训练

摘要

学习率配置是现代深度学习的一个基本方面。在所有层上应用统一学习率的普遍做法忽视了 Transformer 的结构异质性,这可能限制了它们作为 大语言模型 (LLM) 骨干的有效性。在本文中,我们介绍了分层学习率(LLR),这是一种自适应方案,可为各个 Transformer 层分配不同的学习率。我们的方法基于重尾自正则化(HT-SR)理论,该理论描述了权重相关矩阵的经验谱密度(ESD)以量化重尾。重尾较弱的层被分配较大的学习率以加速训练,而重尾较强的层则被分配较小的学习率。通过以这种方式调整学习率,LLR 促进了跨层训练更加平衡,从而实现更快的收敛并提高泛化能力。从 LLaMA 到 GPT-nano 的各种架构、包括 AdamW 和 Muon 在内的优化器以及从 60M 到 3B 参数以及高达 100B 训练词元的模型规模的广泛实验证明了 LLR 的有效性。 LLR 实现了高达 1.5 倍的训练加速,并且始终优于统一学习率基线。特别是,它将1B模型的平均零样本准确率从47.09%提高到49.02%,将3B模型的平均零样本准确率从48.58%提高到50.61%。 LLR 的一个关键优势是其低调整开销:它可以直接从统一基线传输近乎最佳的学习率设置。代码可在 https://github.com/hed-ucas/Layer-wise-Learning-Rate 获取。