论文

SlimKV:免重构信标注意力的联合token-feature KV压缩

SlimKV: Joint Token-Feature KV Cache Compression with Reconstruction-Free Beacon Attention

模型推理KV Cache

摘要

长上下文LLM服务日益受KV缓存内存瓶颈制约,资源受限场景尤甚。既有KV压缩策略中,token级方法减少缓存状态但可能因驱逐或浓缩丢失信息;特征级方法降低每token KV维度但可能需要全维重构以施加位置嵌入,限制解码加速。我们提出SlimKV——问题无关的联合token-feature KV缓存压缩方法:以低秩感知训练把长上下文压缩为带潜KV表示的信标记忆状态,配合层级自适应秩分配。我们进一步发现位置不对称性:移除键侧RoPE对信标与原始token的影响不同,信标token退化小得多。利用该不对称,SlimKV在K侧免RoPE约束下训练信标KV投影,并在解码时启用潜空间注意力,缓解重构延迟。LongBench上SlimKV在16x/32x压缩下超越基线、4x/8x下保持领先(保留未压缩模型96%以上分数);大海捞针证实跨证据位置鲁棒;效率评估显示128K长度下注意力加速至多7.34倍、端到端解码较未压缩模型加速3.38倍。