论文

SGD-KV:汇总引导的 KV 缓存压缩

SGD-KV: Summarization Guided KV Cache Compression

模型推理KV Cache

摘要

由于键值(KV)缓存大小线性增长,大语言模型(LLM)在长上下文推理中面临严重的内存瓶颈。现有的 KV 缓存压缩技术通常依赖于简单的启发式方法,忽略了不同注意力头的不同功能角色。我们提出了 SGD-KV(摘要引导 KV 缓存压缩),这是一种头部感知框架,利用新颖的块摘要诊断任务来系统地识别专门从事分层信息聚合的注意力头并对其进行优先级排序。在 Qwen2.5-7B-1M 和 Qwen3-32B 上跨不同长上下文基准的实验表明,SGD-KV 在高达 1M 词元的上下文中实现了最先进的性能,同时将 KV 缓存内存使用量减少了高达 75%。我们的研究结果表明,根据注意力头的摘要分数分布来战略性地分配 KV 缓存预算可以为长上下文推理带来卓越的效率与准确性权衡。