论文

ValueDiff:依据值向量几何特征选择KV缓存淘汰项

ValueDiff: Value-Geometric KV Cache Eviction for Sink-Suppressed LLMs

模型推理KV Cache

摘要

具有 QK 归一化、门控注意力、学习注意力池或 logit softcapping 的现代 LLM 表现出较弱的持久注意力池,而现有的 KV 缓存驱逐方法主要依赖于此。我们观察到,在这些模型中,较弱的汇与相对于键向量离散度更大的值向量离散度同时出现。受这种价值侧分散的推动,我们提出了 ValueDiff,这是一种价值几何驱逐,根据词元的值向量与缓存平均值的 L2 偏差对词元进行排名。在关于未来注意力的最大熵假设下,最小干扰驱逐会产生相同的分数。我们在固定缓存预算下进行评估,在预填充期间的每个块边界以及生成期间的每个解码步骤进行驱逐。在 RULER 上,在 2k 词元预算紧张的情况下,ValueDiff 在七个接收器抑制模型中保留了 88--99% 的密集度(7 个模型中的 6 个模型最好)。在 4k 预算的 LongBench 上,ValueDiff 在接收器抑制模型中的平均保留率为 92%,而最强的先前基线为 83%。在 MATH-500 上,ValueDiff 是在 25\% 缓存预算下测试的每个接收器抑制模型中最强的非密集方法,在门控注意力模型上比之前的方法高出 $\sim$20 点。在所有三个基准测试中,值几何成为汇抑制模型更可靠的查询不变驱逐信号。