论文

用于长上下文推理的自适应大规模分段 KV 压缩

Adaptive Mass-Segmented KV Compression for Long-Context Reasoning

模型推理KV Cache

摘要

键值 (KV) 缓存的线性增长是长格式 LLM 推理的关键瓶颈。现有的 KV 压缩方法通过根据重要性分数驱逐词元来缓解这一问题。然而,我们表明,它们对全局 Top-k 选择的依赖会触发区域擦除:严重驱逐连续推理块,从而破坏逻辑一致性。为了解决这个问题,我们提出了自适应大规模分段(AMS)KV 压缩,这是一个将范式从 词元级 竞争转变为区域感知配额分配的框架。 AMS 根据注意力质量的空间分布自适应地对 KV 缓存进行分区,确保结构重要的推理段获得有保证的内存配额。为了确保迭代解码过程中的稳定性,采用了基于 EMA 的平滑机制来防止段边界抖动。至关重要的是,AMS 是一个通用的即插即用层,与现有记分器正交。它可以无缝集成到 TOVA、Expected Attention、KeyDiff、R-KV 和 TriAttention 等代表性方法中。 AMS 还与现代分页 KV 服务框架(例如 vLLM)系统兼容,支持高效的收集和压缩 KV 执行,而不会引入额外的稳态注意力开销。跨各种任务的广泛实验,包括数学推理(MATH500、AIME、GSM8K)、代码完成、开放域 QA 和稀疏检索,表明 AMS 始终如一地减轻结构碎片并提高模型性能。