论文
KV²:自精炼KV缓存
KV$^2$: A Self-Refining KV Cache
摘要
KV缓存的内存足迹约束长上下文模型的实用,且当一个预填充上下文后续要服务多个不同查询时成本占主导。在这种可复用设置下,查询无关的压缩在成本与质量间权衡:轻量估计器便宜但欠准,全上下文重构打分更准却要重处理整个提示。我们提出KV²——基于选择性重构的查询无关KV压缩方法:先用轻量代理打分器识别有信息量的上下文token,再只对该子集重处理以计算最终驱逐分。RULER、大海捞针与LongBench上,KV²相对基线的优势随预算收紧而扩大:RULER 16K在2%预算下较次佳基线提升平均分40个百分点以上;LongBench上在2%-10%预算间以低于全上下文重构的压缩阶段运行时与峰值内存取得最高平均分。可复用KV压缩因此不需要重处理完整上下文。代码/项目页:https://anonymous.4open.science/r/KVsquared-0B97。