论文

eOptShrinkQ:通过最佳频谱去噪和量化实现近乎无损的 KV 缓存压缩

eOptShrinkQ: Near-Lossless KV Cache Compression Through Optimal Spectral Denoising and Quantization

模型推理KV Cache

摘要

我们表明,Transformer 注意力头中的键值(KV)缓存允许自然分解为低秩 \emph{共享上下文} 组件和全秩 \emph{per-token} 残差,这可以通过尖峰随机矩阵模型很好地描述。这一观察导致了 eOptShrinkQ,一个两级压缩管道:最佳奇异值收缩(eOptShrink)自动提取共享结构,而残差(满足带有离域坐标的 \emph{薄壳属性})由 TurboQuant~\citep{zandieh2025turboquant} 量化,TurboQuant~\citep{zandieh2025turboquant} 是最近提出的具有接近最佳失真保证的每向量标量量化器。通过恢复标量量化假设的各向同性,频谱去噪消除了对异常值处理和专用内积偏差校正的需要,从而释放了这些位以改进重建。随机矩阵理论的理论基础提供了三个保证:通过 BBP 相变进行自动排序选择、残差上可证明接近零的内积偏差以及确保接近最优量化失真的坐标离域。通过实验,我们在 Llama-3.1-8B 和 Ministral-8B 上跨三个级别验证了 eOptShrinkQ:每头 MSE 和内积保真度,其中 eOptShrinkQ 在同等质量下比 TurboQuant 每个条目节省了近一位; LongBench 上的端到端(16 个任务),其中每个条目 $\sim$2.2 位的 eOptShrinkQ 优于 3.0 位的 TurboQuant;和多针检索,其中 2.2 位的 eOptShrinkQ 与未压缩的 FP16 非常接近或超过,这表明频谱去噪可以作为检索密集型任务的有益正则化器。