论文
ARC-KV:分摊锚点搜索以实现基于重建的 KV 缓存压缩
ARC-KV: Amortizing Anchor Search for Reconstruction-Based KV Cache Compaction
摘要
长上下文大语言模型推理受到随序列长度线性增长的 KV 缓存的瓶颈。对于长的、可重用的上下文前缀来说,这种负担尤其严重,因为它们的缓存必须为许多下游查询提供服务。基于重构的方法(例如注意力匹配)通过紧凑的 KV 缓存实现了强大的下游任务性能。然而,迭代锚点搜索在基于 OMP 的注意力匹配的压缩成本中占主导地位。这激发了我们的选择性摊销原则,即学习跨上下文的可重用的锚选择策略,同时保留特定于上下文的重建。在这项工作中,我们提出了 ARC-KV,一种遵循这一原则的新型基于重建的 KV 缓存压缩方法。为此,我们首先训练一个价值感知索引器,以在单次评分过程中选择真正的关键锚点。然后,ARC-KV 应用凸包约束键合并,并针对完整缓存拟合注意力质量偏差和紧凑值。在推理时,ARC-KV 使用冻结索引器为每个上下文构建一次紧凑缓存,并将其重用于所有后续查询。大量实验表明,在 Llama-3.1-8B-Instruct 上的 QuALITY、RULER 和 LongBench 的大多数设置中,ARC-KV 的性能优于报道的压缩方法。特别是,在 QuALITY 上保留 10% 的 KV 时,ARC-KV 比注意力匹配的准确度从 0.6409 提高到 0.6474,同时将压缩时间减少了 25.73 倍,从 959.8 秒到 37.3 秒。