论文
ELSAA:用于训练的高效低秩稀疏注意力近似 Transformer
ELSAA: Efficient Low-Rank and Sparse Attention Approximation for Training Transformers
摘要
二次 $N\times N$ 注意力得分矩阵仍然是将 Transformer 扩展到更长输入长度的主要障碍。现有的高效注意力方法通常通过施加稀疏性来减少这一瓶颈,以便每个查询仅关注键的一小部分,或者通过使用低秩/内核草图,以便将全局交互压缩为较低维度的表示。我们提出 \emph{ELSAA},一种高效的低秩且稀疏的注意力近似。重要的是,ELSAA 不会将 Transformer 的学习投影或输出矩阵分解为稀疏和低秩因子。相反,在密集投影产生 $Q,K,V$ 之后,ELSAA 近似诱导注意力评分算子本身:稀疏分支捕获选定的高相似性交互,而低秩分支总结分散的全局交互。由于两个分支可以在分母质量非常不同的支持上进行归一化,因此 ELSAA 引入了分母感知融合项,该融合项根据其相对于低秩分支的估计注意力质量来缩放稀疏分支。这为构建低秩和稀疏注意力输出提供了一个实用的框架,无需具体化完整的二次得分矩阵,旨在实现更长的上下文训练,同时保留尖锐的 词元级 交互和广泛的上下文混合。