论文

AnchorKV:Anchor-Residual KV 缓存压缩

AnchorKV: Anchor-Residual KV Cache Compression

模型推理KV Cache

摘要

键值 (KV) 缓存是长上下文 LLM 推理中的主要内存瓶颈。现有的方法从相反的两端对其进行攻击:逐出方法永久丢弃词元,每当丢弃的词元后来被证明是必要的时,就会降低性能,而量化方法以低精度保留所有词元,但提供有限的压缩。我们提出了 AnchorKV,一种压缩方案,可以将缓存缩小 $20\times$,而不丢弃单个词元。 AnchorKV 使用一小组精确存储的锚点表示缓存,通过其最相似的锚点表示每个其他标记,并仅细化那些近似值对模型输出影响最大的标记。 AnchorKV 始终保持跨模型和数据集的准确性,在 70B 规模下保留 99% 的全缓存分数,同时以一小部分成本保持整个上下文。