论文
HLA:Hadamard线性注意力
HLA: Hadamard Linear Attention
摘要
注意力机制是transformer取得成功的重要原因。它依赖计算token之间的成对关系。为降低标准二次方注意力的高计算成本,线性注意力被提出作为一种高效近似。它采用在计算成对相似度之前独立作用于输入的核函数。这使得计算过程高效,但其实际效果等价于一个逼近softmax的低次有理函数。我们提出Hadamard线性注意力(Hadamard Linear Attention,HLA)。与以往线性注意力工作不同,HLA中的非线性不是分别作用于查询和键,而是类似标准softmax注意力那样,在成对相似度计算完成之后施加。我们将证明所提出的非线性等价于一个逼近softmax的更高次有理函数。我们为该方法推导出一种与标准线性注意力类似的高效计算方案。与其他方法不同,应用所提算法无需耗时的张量重排。该方法的有效性通过将其应用于一个用于视频生成的大型扩散transformer模型得到证明,该应用涉及极大量的token。
