论文
学习稀疏注意力模式会随机产生涌现能力
Emergent Capabilities Arise Randomly from Learning Sparse Attention Patterns
摘要
Transformer 语言模型的神经缩放定律预测,随着参数的增加,预训练损失会平稳改善,但众所周知,上下文学习等下游功能会突然出现超过一定的模型规模。在本文中,我们表明,新兴能力在整个训练过程中随机出现,平均而言,较大的模型会更早地获得这些能力。我们证明,模式完成和间接对象识别等能力的出现对应于任务相关注意力模式的突然学习。为了隔离这种现象,我们在合成线性图和元胞自动机数据集上训练 Transformer 模型,并且我们表明学习注意力模式的难度取决于上下文长度和模式稀疏性。此外,扩大注意力头的数量可以提高我们综合任务的学习效率,而增加注意力头的尺寸会导致超过最小容量的回报递减。我们还研究了具有替代注意力机制的架构,结果表明 MLP-Mixer 在具有复杂注意力模式的线性映射任务上优于 Transformer。我们的研究结果提供了对涌现的机制洞察,表明由于 Transformer 模型中学习稀疏注意力模式的内在困难,下游能力突然出现。