论文

KVDiagnosis:长上下文语言模型KV缓存压缩的诊断基准

KVDiagnosis: A Diagnostic Benchmark for KV-Cache Compression in Long-Context Language Models

模型评测基准与评测资源

摘要

KV缓存压缩可减少长上下文内存占用,但聚合任务分数既无法揭示哪些原本正确的执行失败了,也无法说明失败原因。我们提出KVDiagnosis,一个具有三项贡献的诊断数据集和基准。首先,一个涵盖25种方法的分类体系将方法归入五个机制家族,并将其关联到八个经过验证的实现及其有效的诊断测量。其次,对每个受支持的方法设置,我们先在固定切分中对照逐源FullCache控制组评估所有来源,再为每个方法-设置单独筛选FullCache正确/压缩错误(C-to-W)的行,因此没有任何压缩器定义另一个压缩器的测试集。第三,统一的记录格式将成对输出和运行元数据与缓存、似然、注意力和解码测量关联起来,并带有明确的适用状态。在Qwen3-8B上,四个证据感知工作负载在2600个来源上产生59,800次受支持的压缩运行和12,520行C-to-W记录。在固定诊断规则下,63.2%的案例测量/预计覆盖率低或仅部分覆盖。仅有19行(0.2%)同时具备高测量/预计覆盖率与强似然漂移;另有2,126行(17.0%)保持结构位置可寻址性(其表征保真度仍未知),但呈现同样的漂移。相对于C-to-C成功控制组,全部十项诊断都能区分失败与成功的压缩(分层AUROC为0.684-0.871)。在96个可复现的低EAR失败中,受控的4倍证据注意力增强修复了29.2%,而数量匹配的假干预仅修复6.3%,匹配的C-to-C控制组退化3.3%。代码和数据见 https://github.com/ChosenQC/KVDiagnosis。

KVDiagnosis:长上下文语言模型KV缓存压缩的诊断基准:论文配图
图3:全部26002600个来源:(A) 平均任务得分;(B) C→\rightarrowW比率。灰色标记不支持的ThinK/25%;QuantizedCache使用8b/4b/2b,而其他方法使用75/50/25。两个热图展示了八种方法在全部来源上的平均任务得分与压缩导致的失败率。