论文
查询可见性如何改变 KV-Cache 压缩排名:匹配预算审核
How Query Visibility Changes KV-Cache Compression Rankings: A Matched-Budget Audit
摘要
KV 缓存压缩方法主要通过压缩前附加到上下文的查询来评估——一种查询感知协议。然而,压缩 KV 缓存的经济案例是重用:压缩文档一次,就可以回答许多未来针对它的问题。在该部署中,压缩必须与查询无关——在出现任何问题之前。我们针对三个开放 7-9B 模型上的三个简单基线,对六种已发布的压缩方法进行了匹配预算审计(RULER-8192 上有 144,300 次配对评估;LongBench 上有 40,800 次配对评估;整个过程中有 50,000 次重新采样配对引导程序)。除了评分规则之外,一切都保持固定——模型、压缩比、实例、解码。三项发现。 (1) 查询可见性改变了排名:在不可知协议下,在共享共同注意力后端的五种审核方法中,只有 KeyDiff 一致地击败了 best-of-3 trivial 基线(36 个单元中的 31 个),而部署最广泛的方法 SnapKV 平均输给了“保持开始和最近窗口”(-0.066)。 (2) 两个协议之间的每个方法下降的顺序与问题对每种方法的评分信号的可见程度一致,在其源代码中清晰可见:从 SnapKV 的 Delta=+0.198(问题位于其 64 个词元观察窗口内)到 KeyDiff 的 Delta=+0.011(其分数根本不包含查询项)。