论文
DepthKV:用于长上下文 LLM 推理的层相关 KV 缓存修剪
DepthKV: Layer-Dependent KV Cache Pruning for Long-Context LLM Inference
摘要
长上下文推理是 大语言模型 (LLM) 的一项关键功能,可实现长文档理解、摘要和代码生成等应用。然而,高效的自回归推理依赖于键值(KV)缓存,其内存占用随着序列长度线性增长,从而导致主要的内存瓶颈。为了减轻这种开销,KV 缓存修剪方法会在推理过程中丢弃注意力分数较低的缓存词元。大多数现有方法在各层之间应用统一的剪枝率,隐含地假设所有层对整体模型性能的贡献相同。我们证明这种假设不是最理想的,因为各层对修剪的敏感性存在显着差异。我们提出了 DepthKV,一种依赖于层的剪枝框架,它根据层的敏感性在层之间分配固定的全局 KV 预算,而不是使用统一的分配。在多个模型和任务中,DepthKV 在相同的全局修剪比率下始终优于统一修剪,这表明通过层相关的分配可以更有效地利用 KV 缓存预算。