论文

注意力中非线性的紧急逆深度缩放

Emergent Inverse-Depth Scaling From Nonlinearity In Attention

模型评测模型架构Transformer模型行为与机制分析

摘要

缩放定律描述了模型性能随数据集大小和参数数量的幂律改进,但其底层机制尚未完全理解。为了解释参数计数缩放,现有理论假设随模型深度进行幂律缩放。在线性注意力模型中,这种缩放与幂律数据谱相关:无法选择性地关注相关标记,这些模型根据全局谱强度进行学习,在较弱的方向之前学习较强的方向。然而,大型语言模型可能具有很强的非线性。在这里,我们表明非线性注意力在所有测试的数据谱中产生损失的逆深度衰减。非线性使注意力能够选择性地集中在相关标记上,从而允许并行学习强和弱光谱方向。类似的跨层聚焦激发了与中心极限定理的联系:跨层的共享误差设置了损失平台,而聚合将特定于层的差异转化为随深度的持续增益。我们的研究结果表明,深度缩放可能是由非线性引起的 注意力,它允许大型语言模型集中于局部,并可能使全局协方差结构的相关性降低。