论文

探索 KV 缓存驱逐的分层设计空间

Exploring a Layer-Wise Design Space for KV Cache Eviction

模型推理KV Cache

摘要

KV 缓存逐出方法通常在整个模型中使用单个保留规则系列,使逐出方法标识成为模型级设计选择。然而,Transformer 层在注意力行为、表示和对压缩的敏感性方面存在很大差异,这表明统一的规则可能会忽略有用的分层结构。这就提出了一个基本问题:驱逐方法本身是否应该在不同层上有所不同?我们通过跨 Transformer 层组合现有驱逐方法并系统地探索由此产生的分层设计空间来研究这个问题。使用简单的离线配置文件,我们构建固定路线并研究它们的质量如何随方法放置和缓存预算变化。在 LongBench 上,在相同的缓存预算下,异构路由比同构策略提高了大多数任务的性能。即使方法数量保持固定,配置文件引导的放置在 100 个评估的分配中排名第二,这表明路由质量在很大程度上取决于方法的放置位置。此外,在所有五个测试的缓存预算中,相同的固定路由优于九个独立基线中最好的一个。总之,这些结果将分层方法组合确立为 KV 缓存压缩的可利用的、位置敏感的设计维度。