论文

KVSculpt:KV 缓存压缩为 蒸馏

KVSculpt: KV Cache Compression as Distillation

模型推理KV Cache

摘要

KV 缓存压缩对于高效的长上下文 LLM 推理至关重要。减少每对占用空间的方法(量化和低秩分解)与减少缓存序列长度的方法是正交的。沿着序列长度维度,现有的方法包括从纯粹的驱逐(选择保留哪些 KV 对)到合并(将相似的对合并为更少的 KV 对)。两者都保持锚定到原始缓存条目。我们提出了 KVSculpt,它转向了这个范围的另一端:我们不是选择或组合原始对,而是在连续嵌入空间中优化一组较小的无约束 KV 对,以保留每层的注意力行为。键通过 L-BFGS 进行优化,值通过最小二乘法以封闭形式求解,每隔几步交替一次。除此之外,我们引入了自适应预算分配,它使用廉价的试点压缩运行,根据每个组件的难度在各层和 KV 头之间重新分配压缩预算。在具有 2048 个词元上下文的 Qwen2.5-1.5B-Instruct 上,与 Select+Fit(使用最小二乘值拟合的注意力分数驱逐)相比,KVSculpt 在 {0.3,0.5,0.7} 中的压缩比 r 上将 KL 散度减少了 3.5-4.1 倍。自适应分配可额外减少 1.3 倍的 KL,且无需额外的推理成本。分析表明,压缩难度高度不均匀:每层导频 MSE 跨层变化高达 100 倍,单层内的两个 KV 头可能相差高达 467 倍——这表明细粒度的预算分配至关重要。