论文
热启动何时对扩展语言模型有效?
When is Warmstarting Effective for Scaling Language Models?
摘要
从给定检查点开始的模型增长旨在加速更大模型的训练,从而提供潜在的资源节省。尽管最近引起了人们的兴趣,但热启动在大规模训练中的实际应用有限。我们将其归因于两个未充分探索的因素:(1)过分强调在初始化时保留较小模型的性能,这限制了新架构的算子设计;(2)对增长如何与超参数和缩放行为相互作用的分析不足,再加上文献中不一致的增长因素。我们证明,保留基本模型的初始增长后性能对于强大的最终性能来说并不是必需的,并且简单的、与架构无关的增长策略可以胜过更复杂的热启动算子。至关重要的是,我们凭经验确定了增长因子 $g$ 的上限,超过该上限从头开始训练会更有效。我们在多个消融设置中观察到这一点。值得注意的是,这一限制也存在于之前发布的结果中,但未报告。在我们对密集 MLP 和密集语言模型的实验中,我们发现 2 倍增长因子在产生收敛加速方面是最可靠的,在 20 个词元/参数预算下,增益最为明显,并随着预算的增加而减小。我们根据这些观察结果拟合缩放法则,为从业者决定何时增长以及增长多少提供预测指导。总之,我们的分析为模型增长提供了实用指南和经验限制。