论文
精确线性注意力
Exact Linear Attention
摘要
本文介绍了精确线性注意力(ELA),这是一种通过利用核函数的精确分解特性实现 Transformer 注意力的线性计算复杂度的机制,从而消除近似误差。我们通过施加确保非负性、可辨别性和几何可解释性的核约束来识别并解决先前线性注意力的两个关键限制——梯度爆炸和词元注意力稀释。提出了几种核函数,包括 Hadamard Exp Kernel、Summation Squared Euclidean Distance Kernel 和 Subtraction Squared Euclidean Distance Kernel,每个核函数都针对特定的注意力行为量身定制。除了核心注意力公式之外,论文还提出了三项工程创新:(1)超链接结构取代了传统的残差连接以减轻梯度退化; (2)基于双向线性注意力的Memory Lobe模块,它捕获跨层的“转换流”以实现定性记忆和隐式强化学习范式; (3) 用于混合专家 (MoE) 的基于路由评分的偏差机制,以提高可解释性和语义对齐。实验结果表明,与完全注意力相比,ELA 的解码速度提高了 6 倍,KV 缓存使用量减少了 75%,同时保持了相当或卓越的训练性能。所提出的内存模块加速了收敛并增强了泛化能力。此外,我们将线性注意力原理扩展到视觉模型,产生了 YOLO-LAT,它实现了高达 4.3 倍的 GPU 推理加速和 7.9 倍的参数减少,并具有具有竞争力的检测精度。这些结果强调了精确线性注意力对于将 Transformer 模型扩展到超长序列和高效视觉任务的广泛适用性。