论文

Dual-QK:兼顾两比特KV缓存与Query通道裁剪

Dual-QK: Sharp Queries and Flat Keys for Prunable 2-bit KV Caches

模型推理模型优化KV Cache量化稀疏化

摘要

长输入和扩展生成会增加键值 (KV) 缓存的存储和访问成本。低位量化减少了存储和内存流量,而查询通道修剪可以进一步减少键缓存读取。基于旋转的量化可跨通道重新分配关键异常值的能量。为了保持计算不变性,必须将相同的正交变换应用于查询,从而保留查询键点积。然而,这种轮换会分散查询能量,削弱要保留的一些大组件和要修剪的许多小组件之间的分离。我们引入 Dual-QK,它使用成对的非正交查询和密钥转换来解决此冲突。使用校准的查询和密钥统计数据,Dual-QK 将部分密钥白化与查询对齐基础相结合,以平衡 INT2 量化的密钥规模,并集中查询能量以进行动态通道修剪。 Channel-0 保护和桶相关 RoPE 支持长上下文中的低位精度。对五个生成基准和长上下文检索任务的四个模型的实验表明 在查询通道稀疏度为 40% 的情况下,大多数任务的准确性均优于 OSCAR。在 128K 上下文中,相对于未修剪的 BF16,Dual-QK 提供 $6.8\times$ KV 缓存压缩,并且 KV 读取量预计减少 $8.3\times$。在评估的配置下,我们的 SGLang 实现实现了未修剪 BF16 的解码吞吐量高达 $3.75\times$。

Dual-QK:兼顾两比特KV缓存与Query通道裁剪:论文原图
图 1:相同位宽和保留通道预算下的概念比较。 (a) Q-PCA 集中查询能量,而 (b) Hadamard 旋转减少关键异常值。 (c) 双 QK 使用倒数 Q/K 变换来针对这两个属性。点积中省略了阴影线通道。