论文
头部自治:来自冻结查询关键几何的无数据稀疏注意力
Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry
摘要
长上下文 LLM 推理受到二次注意力计算和不断增长的 KV 缓存成本的瓶颈。现有的稀疏注意力和 KV 压缩方法通常决定从运行时注意力分数、观察窗口、校准提示或学习门中保留哪些标记或头部,从而使得头部诊断依赖于输入且部署成本高昂。我们提出了头部自治(AoH),这是一种无数据方法,可以从查询键投影的光谱几何中识别检索和流头部。 AoH 定义了内核注意算子 $M_h = W_K^{h\top}W_Q^h$ 并使用其有效排名作为头函数的权重空间度量:集中谱表示少量主导查询关键匹配方向并与检索头相关,而扩散谱表示不存在主导全局匹配方向并与流头相关。我们进一步推导出有效的 $d_\text{head}$ 维计算,避免构建完整的 $d_\text{model}\times d_\text{model}$ 矩阵。我们对模型进行了广泛的实验,证明在 50% 稀疏度下,AoH 平均保留 96.5% 的完全注意力性能,同时将预填充和解码延迟分别减少高达 41.4% 和 66.0%,在 256K 词元时将 KV 缓存内存减少 50.0%。