论文
稀疏注意力是矩阵近似,而不是从一袋值中进行选择
Sparse Attention Is Matrix Approximation, Not Choosing from a Bag of Values
摘要
大型语言模型 (LLM) 在许多领域都取得了强大的性能,但其效率受到与提示长度相关的二次注意力成本的限制。稀疏注意力通过仅保留一小部分查询键交互来近似完整的注意力矩阵,从而降低了这种成本。然而,现有的方法陷入了数学上错误的观点:它们只是保留注意力矩阵的大标量条目或高质量区域。这将注意力矩阵视为一袋值,忽略了它被用作结构化矩阵,其条目通过与值向量相乘共同确定注意力输出。我们认为这是核心概念问题:稀疏注意力应该被表述为矩阵近似,而不是盲目地从一包条目中选择最大值。基于这个观点,我们提出了矩阵近似稀疏注意力(MASA)。 MASA 用封闭式得分取代了原始注意力质量排名,该得分测量每个稀疏单元减少矩阵乘积近似误差的程度。作为一个基于理论的插件 修正后,MASA 可以添加到现有的稀疏注意力框架中,而无需更改其稀疏内核或预算。跨多种稀疏注意力方法、基准测试和 LLM 主干的广泛实验显示了一致的精度增益,支持 MASA 和稀疏注意力的矩阵近似视图。