论文

终端收缩平均揭示了 LLM 预训练中的进度估算器交互

Terminal Shrinkage Averaging Reveals a Schedule-Estimator Interaction in LLM Pretraining

模型训练预训练

摘要

大型语言模型 (LLM) 预训练通常会返回原始的最终迭代。这结合了两种设计选择:生成参数轨迹的学习率计划和构建部署模型的估计器(例如原始最终迭代或检查点平均值)。促进优化进度的计划可能与最小化原始最终迭代变化的计划不同。分离这些选择创造了一个机会,可以在训练后期保持进度,同时减少返回模型的变化。为此,我们提出\emph{终端收缩平均(TSA)},它在原始最终迭代和最近检查点的平均值之间进行插值,以平衡最近的进展与终端变化。我们分析了 TSA 如何在局部二次近似下改变首选的终端学习率计划,并通过一系列受控 NanoChat 实验测试这种相互作用。最后,我们证明了所得收益转移到深度 22 NanoChat,其中组合的时间表和估计器提高了验证质量。合格的 GPT-2 运行时间也比我们实验中使用的公共基线更快,提供了基准加速的初步证据。