论文
DepthWeave-KV:面向长上下文KV缓存压缩的token自适应跨层残差分解
DepthWeave-KV: Token-Adaptive Cross-Layer Residual Factorization for Long-Context KV Cache Compression
摘要
长上下文语言模型推理日益受存储KV缓存所需的内存带宽与容量限制,但既有压缩方法常跨层或跨token施加统一预算——当词法线索与语义状态需要不同保留时损害检索。我们引入DepthWeave-KV:token自适应的缓存压缩方法——用共享低秩通道基底跨相邻Transformer层分解键值状态,同时在注意力行为敏感处保留轻量的token专属残差。DepthWeave-KV结合跨深度残差分解与token条件深度路由——为承载指令与检索关键的token分配更高的重建秩——并使用来自注意力输出探针的免校准在线误差跟踪,在生成期间自适应压缩而无需重训基座模型。融合CUDA实现联合执行基底查找、残差反量化与注意力投影以降低解码期内存流量。跨LongBench、大海捞针、L-Eval及长问答与摘要基准:DepthWeave-KV以显著更低内存取得近全缓存任务质量——平均分与检索准确率超既往压缩缓存,同时达到8.3倍KV内存削减与64K上下文下72.8 token/s。
