论文

AttSVD:提示自适应的低秩 KV 特征压缩

AttSVD:Prompt-Adaptive Low-Rank KV Cache Compression via Attention-Guided SVD

模型推理KV Cache

摘要

自回归 Transformer 的键值(KV)缓存随上下文长度线性增长,成为长上下文的主要内存开销。多数免训练方法沿序列轴不可逆地驱逐低重要性词元。我们保留所有词元,改为沿特征轴降低存储成本,提出 AttSVD。它从每个提示自身的注意力几何构建可解释低秩基:在线执行逐提示截断 SVD,只保留注意力实际读取的方向,使每头持久 KV 内存按保留秩缩减。针对短生成与长生成,我们提出累积式和流式两种解码缓存策略。另有两项自适应改进:逐矩阵能量规则独立确定 logits 空间与注意力质量的规模;注意力感知基仅在实际读取空间截断,同时保留注意力 logits 与输出。相同因子还能免费提供逐头有效秩和读取几何的解释。在多个模型的 Agentic 基准与完整 LongBench 上,AttSVD 以约一半 KV 缓存内存保持接近稠密缓存的表现。

AttSVD:提示自适应的低秩 KV 特征压缩:论文原图
图5:低秩KV缓存 $K$ 的SVD因子,来自SmolLM2-135M的一个层/头。(a)注意力图;(b)原始KV能量SVD与查询加权注意力感知SVD的奇异值谱;(c)每词元因子权重 $|U|$;(d)各因子的主要词元及其能量占比。