论文

相信质量:KV 缓存驱逐中的强制权重

Trust the Mass: Forced Weights in KV-Cache Eviction

模型推理KV Cache

摘要

每个部署的稀疏注意力或 KV 缓存驱逐规则都会保留键的子集,丢弃其余部分,并在保留的集合上重新规范化注意力权重。枚举来自五个模型的 $168{,}192$ 注意力行的约束下的确切最佳子集表明,保持最大权重已经接近最佳,因为最佳子集仅缩小了与完全注意力的剩余差距的中位数 $2$ 到 $5\%$。如果选择关闭得这么少,则逐出方法之间已发布的边距必须来自其他地方,因此我们测量每个方法持有的字节数。在共享评估管道中,最强的与查询无关的方法保留完整的缓存,因为它们的每头选择被存储为掩码,并且只有不规则的每头存储才能释放该内存。对一项固定选择执行名义预算需要花费 14 美元到 62 美元的基准点。我们将 87.6 美元点的检索余量追踪到问题可见时计算的排名。 ContourKV 是一个根据质量下降统计数据构建的 无需训练 分配器,与现有技术相比,在 160 美元的配对比较中赢得了 93 美元,在预算执行基线的字节数上损失了 22 美元,并且它与其中最强的一个平起平坐。