论文

PatchKV:KV缓存的权重空间补偿

PatchKV: Weight-Space Compensation of KV Cache

模型推理KV Cache

摘要

大语言模型 (LLM) 的长上下文推理受到键值 (KV) 缓存线性增长内存的瓶颈。现有的压缩方法通过词元驱逐或近似来减少缓存,但在激进的压缩预算下会急剧下降。我们提出了 PatchKV,这是一种免训练框架,通过在模型的权重中携带部分上下文来补偿 KV 缓存压缩方法。 PatchKV 将现成的压缩 KV 缓存与特定于上下文的权重补丁配对,该权重补丁在上下文加载时计算一次,并为上下文的下游查询提供服务。通过在完整缓存和压缩缓存下对齐上下文导出的参考查询词元的逐块激活,通过岭回归以封闭形式导出权重补丁。一旦合并到模型中,补丁就会在单上下文、多查询设置中保持前向图和每个查询的推理成本不变。在三种模型架构的长上下文 QA(SCBench,具有多达 170K 词元、SQuAD、NIAH)和数学 (GSM8K) 基准测试中,PatchKV 不断改进缓存压缩方法,提出了在激进的预算下补偿它们的替代方向。