论文

DepthWeave-KV:面向长上下文KV缓存压缩的token自适应跨层残差分解

DepthWeave-KV: Token-Adaptive Cross-Layer Residual Factorization for Long-Context KV Cache Compression

模型推理KV Cache

摘要

长上下文语言模型推理日益受存储KV缓存所需的内存带宽与容量限制,但既有压缩方法常跨层或跨token施加统一预算——当词法线索与语义状态需要不同保留时损害检索。我们引入DepthWeave-KV:token自适应的缓存压缩方法——用共享低秩通道基底跨相邻Transformer层分解键值状态,同时在注意力行为敏感处保留轻量的token专属残差。DepthWeave-KV结合跨深度残差分解与token条件深度路由——为承载指令与检索关键的token分配更高的重建秩——并使用来自注意力输出探针的免校准在线误差跟踪,在生成期间自适应压缩而无需重训基座模型。融合CUDA实现联合执行基底查找、残差反量化与注意力投影以降低解码期内存流量。跨LongBench、大海捞针、L-Eval及长问答与摘要基准:DepthWeave-KV以显著更低内存取得近全缓存任务质量——平均分与检索准确率超既往压缩缓存,同时达到8.3倍KV内存削减与64K上下文下72.8 token/s。

DepthWeave-KV:面向长上下文KV缓存压缩的token自适应跨层残差分解:论文配图
图 1:DepthWeave-KV 概述:该方法不是均匀压缩所有层和令牌,而是在相邻层之间编织共享深度库,并且仅将剩余容量花费在其注意力行为表明检索或指令重要性的令牌上。