论文

HeadQ:KV 缓存量化的模型可见失真和分数空间校正

HeadQ: Model-Visible Distortion and Score-Space Correction for KV-Cache Quantization

模型推理KV Cache

摘要

KV 缓存量化器通常会优化存储空间重建,即使注意力通过 logits 读取键并通过注意力加权读出读取值。我们认为持久缓存错误应该在模型可见坐标中进行测量。对于键,可见对象是分数误差模常数移位;这产生了 HeadQ,一种键端方法,它在校准学习的查询基础中存储低秩残差端代码,并将其应用为附加的 logits 校正。对于值,固定注意力读出给出 $A^2$ 加权词元失真代理。在六个模型中,Fisher/分数空间误差对注意力 KL 的预测效果远好于原始密钥 MSE;相同预算反例、零空间干预、查询 PCA 控制和错误符号 HeadQ 伪造了存储 MSE 替代方案。匹配的 Pythia 检查点将主要异常定位到小模型低熵路线翻转边界。在具有密集值的仅 K WikiText-103 解码实验中,HeadQ 消除了最强 2 位行上大约 $84$--$94\%$ 的过度困惑;在辅助全 KV 2 位组合中,HeadQ 加上 $A^2$ 值策略改进了所有六个模型。