论文
表征 Transformer 中局部注意力的表达能力
Characterizing the Expressivity of Local Attention in Transformers
摘要
Transformer 是最流行的语言建模神经架构。 Transformer 的基石是其全局注意力机制,它允许模型在生成下一个词元之前聚合所有先前词元的信息。注意力的一种常见变体称为局部注意力,它将每个标记限制为从前辈的有界窗口中聚合信息,从而将全局注意力的二次成本降低为线性。尽管这种限制通常是出于效率的考虑,但人们发现它也可以提高模型质量,但迄今为止这种现象还缺乏令人满意的解释。我们从识别器表达能力的角度对这种现象进行了正式的解释。事实证明,具有全局注意力的固定精度 Transformer 对应于包含单个过去运算符的线性时序逻辑片段。我们还证明,添加局部注意力会引入第二个时间运算符,严格扩大可识别的常规语言的类别。此外,全局注意力和局部注意力明显是互补的:两者都不包含对方,将它们结合起来会产生最丰富的片段。形式语言识别和自然语言建模的实验证实了该理论,表明混合全局-本地 Transformer 优于仅全局的对应物。