论文
量化超参数传递和嵌入层学习率的重要性
Quantifying Hyperparameter Transfer and the Importance of Embedding Layer Learning Rate
摘要
超参数传输允许从小规模到大规模推断最佳优化超参数,这对于训练 大语言模型 (LLM) 至关重要。这是通过将缩放法则拟合到超参数或通过明智地选择参数化来完成的,例如最大更新($μ$P),它使最佳超参数近似缩放不变。在本文中,我们首先开发一个框架,通过三个指标来量化超参数传递:(1)缩放定律拟合的质量,(2)对外推误差的鲁棒性,以及(3)由于参数化选择而导致的渐近损失惩罚。接下来,我们通过一系列全面的消融来调查为什么 $μ$P 似乎能够提供相对于标准参数化(SP)的高质量学习率迁移,因为现有理论是不够的。我们发现,当使用 AdamW 进行训练时,$μ$P 相对于 SP 的压倒性优势仅仅来自于最大化嵌入层的学习率。在SP中,嵌入层学习率是导致训练不稳定的瓶颈;将其增加一个宽度因子以匹配 $μ$P 可以极大地平滑训练,同时改善超参数传输。我们还发现权重衰减改善了缩放定律拟合,而在每个参数固定标记设置中,它损害了外推法的鲁棒性。