论文

TaSQ:为1-bit KV缓存压缩定制量化空间

Tailoring the Quantization Space for 1-Bit KV Cache Compression

模型推理KV Cache

摘要

KV缓存是长上下文LLM推理的主要内存瓶颈,对内存容量与带宽施加重压。为缓解该瓶颈,向量量化(VQ)已成为激进KV压缩的有前途方法,但既有VQ方法在1-bit状态下显著退化——如此极端的压缩下每个码本须用有限质心表示更大的通道组,有效利用其容量日益困难。为此我们提出TaSQ:组合查询引导通道加权、跨头归一化与协方差感知通道分组来定制VQ目标空间,更好反映缓存激活的误差敏感性与统计结构。由于这些变换RoPE兼容且可轻松合并进投影权重与码本,TaSQ保持常规VQ查找结构并增加可忽略的服务开销。跨通用、长思维链推理与长上下文检索基准,TaSQ持续优于既有低比特KV VQ基线并保持推理稳定性;在单张RTX 6000 Ada上,其SGLang实现支持最大14倍的批量、较BF16基线取得1.87倍峰值吞吐。