论文
LLM 最优超参数的可预测缩放定律续 预训练
Predictable Scaling Laws of Optimal Hyperparameters for LLM Continued Pre-training
摘要
预训练 对 大语言模型 (LLM) 的持续功效取决于超参数配置,例如学习率和批量大小。然而,当前的实践通常依赖启发式或网格搜索,导致训练不稳定和成本过高。在这项工作中,我们首先凭经验发现最佳超参数在整个 预训练 过程中遵循稳定且可预测的缩放定律。利用这些见解,我们提出了一个新颖的框架来建立给定检查点的计算预算和最佳超参数之间的定量关系。我们的方法有两个阶段:(1)\textit{经验法则发现},我们训练小规模代理模型,以通过标准损失计算缩放法则导出将计算预算映射到最佳超参数的函数; (2) \textit{状态感知超参数预测},我们评估初始检查点的验证损失并使用逆缩放定律来估计其 \textit{等效的 预训练 计算}——从头开始实现相同损失所需的计算。将此与计划的计算预算相结合,我们预测目标运行的最佳超参数。经验结果表明,我们的方法将超参数搜索开销减少了高达 90%,同时实现了与基线相当或更好的性能。这种与模型无关的框架可以跨架构推广,为从任何给定点开始的各种持续 预训练 场景提供原则性且有效的方法。