论文
为什么更大的模型了解更多:容量、干扰和稀有任务保留的影响
Why Larger Models Learn More: Effects of Capacity, Interference, and Rare-Task Retention
摘要
较大的模型可以学习较小模型所无法学习的任务。是什么推动了这种现象?我们提出了一个简单的现象学论点,即幂律缩放已经表明,即使有无限的训练数据,较大的模型也能够学习较小模型无法学习的部分数据分布。为了验证这一说法并确定其原因,我们研究了模型缩放对由显示单调缩放曲线的任务混合组成的合成设置的影响。结果表明数据引发了对资源(神经元)的竞争。具体来说,较小的模型将其神经元分配给高频或低复杂性的任务,因此它们学习的解决方案在稀有和复杂的任务上表现不佳。此外,即使存在能够表达所需任务的解决方案,这种情况也会发生。然后,我们评估更大的模型如何规避这种以数据为中心的瓶颈,发现它可以追溯到减少干扰的机制:更大的模型可以为常见任务分配足够的资源,使这些任务的梯度更新变弱,这意味着它们不会在缓慢积累时覆盖稀有任务特征。最后,为了进一步验证这些说法,我们针对不同频率和复杂性的新任务预训练 OLMo 模型(4M 到 4B 参数)。结果反映了我们的合成数据实验的结果:只有较大的 OLMo 模型才能学习不频繁且复杂的任务,并且这些较大的模型在其表示中嵌入了更多的任务特征,并且任务之间的梯度干扰较小。总的来说,我们提供了一个以数据为中心的解释,解释了为什么较大的模型可以学习较小的模型无法学习的任务。这有助于解释为什么较大的模型在实践中更好,并且可以为有关模型大小和训练数据混合的实际问题提供信息。