论文

FreqDepthKV:频率引导的深度共享实现长上下文LLM推理的鲁棒KV缓存压缩

FreqDepthKV: Frequency-Guided Depth Sharing for Robust KV Cache Compression in Long-Context LLM Inference

模型推理KV Cache

摘要

长上下文LLM推理日益受KV缓存的内存与带宽成本限制,但激进压缩会移除检索与多步推理所需的层特定证据。我们提出FreqDepthKV:推理时缓存压缩方法——把相邻层KV状态分解为共享低频深度分量与稀疏高频残差。轻量在线探针按注意力头对重建敏感注意力logit的贡献,为其分配共享深度、残差深度或精确缓存模式——使压缩策略无需重训即可适应提示结构。跨长上下文问答、大海捞针、摘要与代码生成基准:FreqDepthKV在显著更小的缓存预算下保持任务准确率。32k token prefill窗口下:FreqDepthKV取得58.3精确匹配、63.0 F1、32.5 ROUGE-L与48.1 pass@1——紧贴全KV并超越既往压缩缓存方法;还把解码吞吐提升至70.4 token/s、TTFT降至2.06秒、KV峰值内存降至6.2GB——有效压缩比3.9倍。

FreqDepthKV:频率引导的深度共享实现长上下文LLM推理的鲁棒KV缓存压缩:论文配图
图 1:核心思想概述:FreqDepthKV 删除相邻层共享的冗余深度信息,同时保留控制检索敏感注意力的稀疏层特定标记证据。