论文

KV-COBRA:通过协同优化的位列分配进行 KV 缓存压缩

KV-COBRA: KV Cache Compression via Co-Optimized Bit-Rank Allocation

模型推理KV Cache

摘要

是什么限制了极端比特率下的 KV 缓存压缩?我们认为这不是压缩方案的选择,而是其预算如何在注意力头之间分配。现有方法统一应用秩和位宽,忽略每个头具有不同的秩截断和量化的最佳组合。我们表明,仅使用标准低秩投影和标量量化来共同优化每个头的秩和位宽,在统一分配中占主导地位,并在低比特率下获得最大收益。我们的方法 KV-COBRA(协同优化比特等级分配)将其形式化为资源分配问题:它平衡每个头内的等级截断损失与量化损失,然后在各个头之间重新分配预算以最小化总失真。融合的 Hadamard 旋转均衡了每个通道的方差,并通过注意力 KL 重要性对 SVD 基础进行重新排序,使求解器具有查询感知能力。相同的分配器扩展到联合 $K{+}V$ 压缩。在从每维度 0.5 美元到 4 美元比特 (bpd) 的困惑度、零样本和长上下文基准测试中,KV-COBRA 在低 bpd 的评估方法中显示出最小的精度下降,并且没有每个词元的开销。