论文
CompKV:用于长上下文 LLM 推理的补偿感知 KV 选择
CompKV: Compensation-Aware KV Selection for Long-Context LLM Inference
摘要
尽管性能强劲,大型语言模型 (LLM) 在长上下文推理过程中仍受到 KV 缓存流量的瓶颈。稀疏注意力广泛用于通过计算选定标记子集的精确注意力来加速 LLM 推理。为了恢复从精确注意力中排除的标记的贡献,最近的方法对省略的注意力尾部应用粗粒度补偿。然而,现有方法通常根据注意力质量选择标记,然后才补偿未选择的标记。这种解耦设计忽略了它们的相互作用:选择应该优先考虑如果省略的话会留下最大补偿误差的词元。为了解决这个限制,我们引入了 CompKV,这是第一个补偿感知稀疏注意力框架,它将词元划分为块并显式优化下游补偿机制的选择。我们的理论分析表明,块级均值补偿留下的残差受块注意力质量和块内logit变化的控制。我们使用紧凑的块级统计数据来近似该残差,从而产生可部署的选择标准。我们进一步开发了高效的异步实现。 RULER 和 LongBench-Pro 上的实验表明,CompKV 在评估的稀疏基线中表现最佳,同时与完全注意力相比,自注意力加速高达 6.85 倍。