论文
开关注意:走向动态和细粒度混合 Transformer
Switch Attention: Towards Dynamic and Fine-grained Hybrid Transformers
摘要
注意力机制一直是现代 Transformer 架构的核心组件。然而,标准全注意力的计算与序列长度呈二次方关系,成为长上下文语言建模的主要瓶颈。滑动窗口注意力限制上下文长度以提高效率,但代价是接受域变窄。虽然现有的努力试图通过构建混合模型来获得双方的利益,但它们经常诉诸于静态的、启发式设计的交替模式,这限制了各种场景中计算的有效分配。在本文中,我们提出了 Switch Attention(SwiAttn),这是一种新颖的混合 Transformer,可以在完全注意和滑动窗口注意之间实现动态和细粒度的路由。对于每个 Transformer 层的每个标记,SwiAttn 动态地将计算路由到用于全局信息聚合的全注意力分支或用于高效本地模式匹配的滑动窗口分支。自适应正则化目标旨在鼓励模型提高效率。此外,我们采用持续预训练来优化模型,将全注意力架构转移到混合架构。在常规(4K)和长(32K)上下文长度的 23 个基准数据集上进行了广泛的实验,证明了所提出方法的有效性。