论文
PAGE:分区感知门控 KV 缓存驱逐
PAGE: Partition-Aware Gated KV-Cache Eviction
摘要
KV 缓存驱逐的作用不仅仅是压缩。在长上下文 LLM 中,仅保留一些缓存的标记有时会匹配或超过全缓存的准确性,因为许多冗余的预填充标记会分散人们对带有答案的标记的注意力。这种好处并不统一,并且逐出错误的词元可能会将需要精确检索的任务的准确性降至零,因此有用的问题不仅是要保留哪些词元,而且还在于是否要逐出此输入。我们展示了一个从预填充注意力计算得出的无标签数字,即早期层和晚期层之间在注意头同意读取哪些标记的程度方面的下降,在任何解码之前预测每个输入,输入属于两种情况中的哪一种。我们将其构建到 PAGE(分区感知门控驱逐)中,这是一个包装器,可以在 drop 较大时运行任何 SnapKV 风格的驱逐器,并在 drop 较小时保留完整缓存,无需训练、标签或微调。 PAGE 是一种安全机制,而不是压缩机,因此我们通过它防止的故障来衡量它。它将容量限制输入的危害率从 0.75 降低到 0.026,并且随着预算的缩减,使用 Mistral-7B 普通 SnapKV 进行多密钥检索时的危害率从 99\% 降至 0\%,而 PAGE 将其保持在 89\%。在其他地方,它通过不变地传递基本逐出器,这是预期的行为,也是我们在 16 个单元中的 8 个单元中观察到的情况。代码可从此 https URL 获取。