论文

对返回的模型进行训练:改进迭代平均语言模型的优化

Training for the Model You Return: Improving Optimization for Iterate-Averaged Language Models

模型训练预训练

摘要

许多现代语言模型 (LM) 管道返回平均模型,例如训练迭代的指数移动平均值,而不是最终迭代本身。这就提出了一个基本问题:鉴于我们将返回迭代平均值,我们应该如何改变训练以提高该平均值的性能?我们通过将迭代平均估计器的优化器设计制定为最优控制问题来研究这个问题。在连续时间随机二次模型中,我们求解控制策略,该策略最大限度地减少返回平均值的误差,并受到干预规模的惩罚。该控制器的实用近似产生了 PACE,它是 AdamW 的一个轻量级包装器,它通过修剪的、每个坐标的控制强度将实时权重拉向其指数移动平均值。我们证明了 PACE 的程式化版本以标准随机凸优化率收敛,达到取决于平均规则的因子,而在二次设置中,它可以严格改善迭代平均估计器的极限平方误差,并且可以在某些情况下通过任意大的因子来实现这一点。根据经验,我们的结果表明,在 1-2B 参数 LM 的监督 微调 以及 FineWeb 上的 GPT-2 预训练中,PACE 比 AdamW 和 EMA 评估的 AdamW 有所改进,适用于各种学习率、衰减时间表和其他超参数。