论文

顺序预训练为何更有利于大模型?

Sequential Pretraining Favors Large Models

模型训练模型优化预训练持续学习小模型/轻量模型

摘要

大型神经网络通常会获得小型模型无法学习的能力。这是否源于大型模型学习更具代表性的特征,或者源于对训练期间引入的未解释的不利影响更加稳健?我们定义并量化了这样一种不利影响,即首要偏差,即早期数据分布对以后学习的损害程度。我们表明,小模型可以将学习能力低效地分配给早期分布,而充分过度参数化的模型对于这种效果是稳健的。这种低效率在预训练中尤其严重,因为基础模型经常顺序而不是联合地遇到异构数据分布。因此,小型基础模型可能很难学习训练后期遇到的分布,当后期数据强调代码、数学和推理等所需能力时,这尤其有害。受这些发现的启发,我们引入了暴露疗法(ET),这是一种简单的正则化方法,可以促进更有效的学习分配 顺序预训练期间的容量。我们证明,ET 提高了基础模型在后期数据分布上的性能以及高达十亿参数规模的模型的整体能力。总的来说,我们的结果表明,大型基础模型的一些好处可能来自于对不利训练效果的更大鲁棒性,而不是来自学习更具代表性的特征,并且改进的训练算法可以在较小的模型中恢复其中的一些优势。