论文
Flexformer:具有可学习注意力内核的灵活线性 Transformer
Flexformer: Flexible Linear Transformer with Learnable Attention Kernel
摘要
Transformer 模型依靠注意力机制来捕获长程依赖性,但受到二次复杂度的影响,限制了其对长序列的可扩展性。基于内核的线性注意力降低了这种复杂性,但通常依赖于固定或弱可学习的内核,限制了表达能力和性能。在这项工作中,我们提出了 Flexformer,一种灵活的线性 Transformer,它以完全数据驱动的方式学习注意力内核。 Flexformer 基于随机傅里叶特征的线性注意力构建,并将频谱频率视为可训练参数,使模型能够学习广泛的注意力内核。我们开发了固定和非固定变体,后者提供了更大的表现力。关于语言建模和序列分类的大量实验表明,Flexformer 始终优于基线。此外,Flexformer可以有效地从预训练的Transformer中提取出来,以恢复softmax注意力,并表现出强大的跨域内核可迁移性,在长序列任务上实现高效率和有竞争力的性能。