论文

LaplacianFormer:用拉普拉斯核重新思考线性注意力

LaplacianFormer:Rethinking Linear Attention with Laplacian Kernel

模型架构Transformer

摘要

Softmax 注意力的二次复杂度是将 Transformer 扩展到高分辨率视觉任务的主要障碍。现有的线性注意力变体通常用高斯核代替 softmax 以降低复杂性,但这种近似缺乏理论基础,并且往往会过度抑制中范围 token 交互。我们提出 LaplacianFormer,一种 Transformer 变体,在经验观察和理论分析的推动下,采用拉普拉斯核作为 softmax 的原则替代方案。为了解决低秩近似下的表达能力下降问题,我们引入了一种可证明的单射特征图,它保留了细粒度的标记信息。为了高效计算,我们采用核矩阵的 Nyström 近似,并使用 Newton-Schulz 迭代求解所得系统,避免了昂贵的矩阵求逆和 SVD。我们进一步为内核和求解器开发自定义 CUDA 实现,从而实现适合边缘部署的高吞吐量前向和后向传递。 ImageNet 上的实验表明,LaplacianFormer 在提高注意力表达能力的同时实现了强大的性能效率权衡。