论文

以多样性与层深度改进 KV Cache 淘汰评分

Beyond Mean Attention: Diversity-Aware, Layer-Wise Scoring for KV Cache Eviction

模型推理KV Cache

摘要

KV 缓存驱逐方法(例如 SnapKV 和 PyramidKV)仅通过小观察窗口的平均注意力对词元进行排名。我们研究统一的分数 $μ_i+λ_1σ_i+λ_2corr(i,S)$,增加跨窗口查询的注意力分散和相对于所选标记的冗余。对于 $λ_2<0$,分数会惩罚与最大边际相关性 (MMR) 中所选标记的相似性,而无需额外的前向传递。为了测试这种相关性-多样性平衡是否应该随深度而变化,我们将固定全局系数与三段和二次曲线进行比较。在 $\sinh$ 重新参数化下的开发拆分中仅搜索这些深度剖面。在使用 Mistral-7B 的所有 16 个英语 LongBench 数据集上,每层预算为 64 个条目,单个全局多样化常数改进了 16 个数据集中的 13 个(宏观 +1.1);增益保持在预算 32 并缩小到 128。每个数据集搜索在大多数数据集上没有发现可检测的层结构;在段落检索中,它发现了一个大的:中间层符号翻转奖励相似性,在预算 64 的基线上价值 +9.6,并且在不重新调整的情况下,在预算 128 的全局常量上价值 +13.2。消融将增益归因于冗余项;在保留的测试集上重播每个接受的搜索状态可以将真实结构与调整噪声分开。