论文
局部混合如何编码全局 NoPE 注意力中的相对位置
How Local Mixing Encodes Relative Position in Global NoPE Attention
摘要
注意操作本质上是位置不变的。然而,位置信息是自然语言的基础,因此在基于Transformer的模型中开发了各种显式位置编码,例如旋转位置编码(RoPE)。尽管长期以来一直认为需要显式位置编码,但最近在全局注意层中交错局部混合层(例如滑动窗口注意(SWA)和门控线性注意,而不编码位置(NoPE))的最新方法最近被证明在规模上是成功的。这种方法如何以及为何起作用尚不清楚。在本文中,我们解释了此类混合模型如何隐式编码全局 NoPE 层的位置。在理论和经验证据的支持下,我们的中心论点是,SWA 和门控线性注意力会引起残差流中的新近度偏差,该偏差传播到全局注意力logits并由全局注意力logits选择。此外,与仅具有全局 NoPE 注意力的模型中发现的隐式位置编码相比,其中位置信息仅来自因果掩码,混合模型中的新近度偏差可以在长序列中保持。除了加深我们对混合模型如何编码位置的理解之外,这些发现还可能为如何以可以无限推断更长序列长度的方式编码位置提供见解。