论文
无需训练 通过二元主成分进行基于哈希的注意力
Training-Free Hashing-Based Attention via Binary Principal Components
摘要
长上下文 大语言模型 (LLM) 越来越多地部署在现实世界的应用程序中,但由于需要重复处理不断增长的键值 (KV) 缓存,自注意力仍然是主要的效率瓶颈,尤其是在解码过程中。现有的稀疏注意力通过关注较少的 KV 对来减少计算,但通常会遭受严重的准确性下降,需要额外的训练,或依赖昂贵的散列。在这项工作中,我们提出了 BinaryPC,一种 无需训练,针对长上下文 LLM 的基于数据感知哈希的稀疏注意力。 BinaryPC通过计算数据的二进制主成分来构造紧凑的二进制哈希码和相应的哈希函数。与具有与数据无关的随机投影或学习的非线性哈希方法的局部敏感哈希 (LSH) 不同,BinaryPC 构造的二进制代码可以显式保留数据的结构信息,而不需要基于梯度的训练。跨多个模型系列和长上下文基准的综合实验表明,BinaryPC 保留了相对于完全注意力的准确性,同时在稀疏和基于哈希的基线中实现了卓越的性能。在现代 GPU 上,BinaryPC 比 FlashAttention 内核将端到端解码吞吐量提高了 3.56$\times$。我们的代码可在 https://github.com/yudaohai666/BPC 获取。