论文

DeferKV:重新思考一次性 KV 缓存压缩的逐出时机

DeferKV: Rethinking Eviction Timing for One-Shot KV Cache Compression

模型推理KV Cache

摘要

长上下文大语言模型 (LLM) 在广泛的任务中展示了强大的功能,但不断增长的 KV 缓存引入了大量的记忆和推理开销。现有的一次性 KV 缓存压缩方法通常在预填充之后、在实际生成的任何信号可用之前立即进行不可逆转的逐出。我们的定量分析表明,来自实际生成阶段的早期查询提供了与后续解码注意力更加一致的注意力信号,最大的单步增益出现在预填充解码边界。基于这一观察,我们提出了 DeferKV,它将驱逐决策从预填充的末尾移至第一个真正的解码步骤,并在时间上结合提示端和解码端的观察,从而更好地将 KV 重要性估计与后续生成要求保持一致。 DeferKV 不需要额外的训练、草稿模型或未来查询预测模块,使其简单且易于部署。在 LongBench、RULER 和 Needle-in-a-Haystack 上的实验表明,DeferKV 在 KV 缓存压缩下持续提高模型性能,同时保持较低的推理延迟。

DeferKV:重新思考一次性 KV 缓存压缩的逐出时机的原论文方法或结果图
图 3:DeferKV 概述。第一个真实的解码查询与最近的提示查询相结合,并进行时间加权,以估计后续缓存压缩的 KV 重要性。