论文

风险控制的 KV 缓存驱逐:从内存预算到风险目标

Risk-Controlled KV-Cache Eviction: From Memory Budgets to Risk Targets

模型推理KV Cache

摘要

KV 缓存驱逐通常通过平均质量内存权衡来评估,但较小的平均损失可能会隐藏实用性大幅下降的请求。我们将逐出重新表述为部署风险控制问题:当逐出使任务效用相对于同一请求的全 KV 推理降低超过部署指定的容差时,就会发生材料降级,而部署风险是此类事件的发生频率。给定指定目标风险水平和置信度要求的可靠性合同,我们使用与压缩机无关的事后认证程序,从具有有限样本保证的校准数据中选择保留策略,当没有压缩策略经过认证时,回到完整的 KV。在多种驱逐方法、Llama 和 Mistral 模型以及 LongBench 和 RULER-32K 中,同一个合约支持截然不同的驱逐级别:在 Llama 上,它证明 SnapKV 在 LongBench 上的保留率为 75%,但在 RULER-32K 上没有经过测试的压缩策略,从而触发全 KV 回退。经验降级率低于 5% 目标的保单仍可能无法通过有限样本认证;在 Llama LongBench 上,经验阈值选择未经认证的策略,在固定预算方法中保留较少 5-10 个百分点的缓存。所提出的框架将部署级可靠性需求转换为 KV 内存操作点。