论文
ResKV:重建固定预算 KV 缓存压缩的忽略注意力贡献
ResKV: Reconstructing Omitted Attention Contributions for Fixed-Budget KV Cache Compression
摘要
KV 缓存压缩对于高效的长上下文推理至关重要。现有的逐出方法会永久丢弃未选择的词元,从而消除它们对注意力的总体贡献。基于合并的替代方案保留了更多信息,但可能会扰乱应保持准确的保留键和值。我们观察到,缓存驱逐所忽略的信息可以表示为 softmax 注意力的分子和分母中的残差统计量。基于这一观察,我们提出了 ResKV,它将固定的 KV 预算划分为精确的主缓存和重构遗漏词元贡献的紧凑剩余缓存。 ResKV 让主缓存词元和残差条目参与相同的 softmax 归一化,因此残差条目恢复注意力分子和分母质量,而不是充当事后校正。构建时验证代理确定每层和 KV 头的剩余分配,而解码时动态门调整各个查询的剩余贡献。对 LongBench 和 RULER 的全面评估,涵盖查询感知和查询不可知的设置、多个主干、缓存预算和代表性压缩基线,证明了在相同保留 KV 预算下的广泛改进,同时保留了压缩解码的实际效率,包括峰值内存使用和长上下文解码吞吐量。