保护(几乎)是您所需要的一切:结构保护在全球上限 KV 驱逐中占主导地位
Protection Is (Nearly) All You Need: Structural Protection Dominates Scoring in Globally Capped KV Eviction
摘要
我们研究了共享全局解码时间工具下的 KV 缓存驱逐。七个策略(LRU、H2O、SnapKV、StreamingLLM、Ada-KV、QUEST、Random)共享一个提示边界漏洞:如果没有结构保护,它们在六个纯 Transformer 模型(F1$\leq$0.064)上崩溃到接近于零的质量。在每个边界保留 10\% 的缓存可在 $C{=}256$ 的七个 LongBench 模型上恢复 69--90\% 的 $C{=}2{,}048$ 参考上限质量(13\% 保留);十个模型的面板跨度为 68--98\%。注意力质量试点(Qwen2.5-3B,$N{=}30$)说明了原因:位置 0 的接收器持有 ${\sim}75\%$ 的前缀质量,而其他边界标记位于 ${\sim}0.41{\times}$ 统一期望附近,因此注意力评分器保留了接收器,但仍然丢弃结构上关键的标记。有了保护,简化的分数隔离变体在 $K{=}32$ ($Δ{=}0.02$) 上与 TOST 等效;在 $K{=}8$ 时,注意力策略成对收敛,但在 $C{=}256$ 和 $C{=}512$ 上以 0.011--0.021 F1 击败 LRU。忠实的 Ada-KV/QUEST 在 Mistral-7B 和 Phi-3.5 上除了简化变体之外还添加了 ${\sim}0.03$--$0.04$ F1。 Qwen3-4B 上的 NIAH-32K 机制转移试点(解码 vs.\ 预填充,$C{\in}\{512,2048\}$)显示出几乎相同的保护提升(比率 0.99--1.00)。在 64K 时,保护有所帮助,但恢复程度较低;仅当模型已经支持强大的 64K 检索而不逐出时,忠实的每头评分才能与 Gemma-3-4B 上的全缓存上限相匹配,保留率为 6.3%。总体而言:防护为主;一旦边界被守住,得分差异就成为次要的;人均分配带来了进一步的适度收益。