论文
AttSVD:提示自适应的低秩 KV 特征压缩
AttSVD:Prompt-Adaptive Low-Rank KV Cache Compression via Attention-Guided SVD
摘要
自回归 Transformer 的键值(KV)缓存随上下文长度线性增长,成为长上下文的主要内存开销。多数免训练方法沿序列轴不可逆地驱逐低重要性词元。我们保留所有词元,改为沿特征轴降低存储成本,提出 AttSVD。它从每个提示自身的注意力几何构建可解释低秩基:在线执行逐提示截断 SVD,只保留注意力实际读取的方向,使每头持久 KV 内存按保留秩缩减。针对短生成与长生成,我们提出累积式和流式两种解码缓存策略。另有两项自适应改进:逐矩阵能量规则独立确定 logits 空间与注意力质量的规模;注意力感知基仅在实际读取空间截断,同时保留注意力 logits 与输出。相同因子还能免费提供逐头有效秩和读取几何的解释。在多个模型的 Agentic 基准与完整 LongBench 上,AttSVD 以约一半 KV 缓存内存保持接近稠密缓存的表现。
