论文

D-Quant:用于 KV 缓存量化的可漂移熵编码

D-Quant: Driftable Entropy Coding for KV Cache Quantization

模型推理KV Cache

摘要

KV 缓存已成为部署 LLM 的主要瓶颈,因为其内存占用量随着序列长度和批量大小线性增长,对内存容量和带宽造成巨大压力。在各种 KV 缓存压缩技术中,量化因其有效性和易于部署而特别有吸引力。然而,大多数现有方法依赖于固定宽度量化,其中 $b$ 位表示本质上仅限于 $2^b$ 量化级别。随着位宽的减小,可用级别的数量呈指数级减少,导致严重的信息丢失和性能快速下降。我们进一步观察到固定宽度量化无法利用 KV 缓存的高度不均匀分布。经过旋转和归一化后,KV值近似服从正态分布,大部分值集中在中心附近,只有一小部分出现在尾部。然而,固定宽度编码为频繁符号和稀有符号分配相同数量的比特。熵编码自然地利用了这种不均匀性,将较短的码字分配给频繁的符号,将较长的码字分配给稀有的符号,从而大大减少了表示所需的平均位数。然而,它的可变长度输出不适合高度并行的注意力内核,其中高效的反量化和计算依赖于常规的内存布局和固定步长访问。为了弥补这一差距,我们提出了 \textbf{D-Quant},这是一种灵活的 KV 缓存量化框架,它引入了 \textbf{drift} 机制,将每个词元的熵编码表示转换为固定大小的比特流,从而在注意内核中实现常规内存访问和并行反量化。