论文

LORE-KV:以 Monte Carlo 估计 KV 缓存驱逐代价

Monte Carlo Estimation for KV Cache Eviction

模型推理KV Cache

摘要

大多数 KV 缓存驱逐方法都会询问,实际上,在阅读提示时哪个记忆显得很重要?相反,我们会问,回答时哪个记忆很重要?由于解码查询在驱逐时不可用,因此先前的未来感知方法依赖于伪响应或综合未来查询估计。我们将固定预算的未来感知驱逐作为对合理模型条件查询轨迹的分布估计,并引入 LORE-KV(用于键值缓存的可靠性加权集成的前瞻输出扰动),这是一种 无需训练方法,该方法从冻结的目标模型中采样短自回归延续,并使用其响应端查询状态来估计提示 token 效用。 token 通过预计的留一注意力输出删除成本进行评分,并通过可选的轨迹权重对采样的未来进行汇总。临时延续在最终解码之前被丢弃,不需要辅助模型或训练。 消融 隔离机制:在 B=128 时,单个响应端延续恢复了提示窗口控制的约 89% 的增益,而额外的 future 提供了较小的改进。在 B=128 时,LORE-KV 将 Qwen2.5-14B 上的 LongBench 平均值从 45.49 提高到 48.24 (+2.75),将 Mistral-7B 上的 16K RULER 平均值从 45.20 提高到 51.05 (+5.85)。缓存预算越大,收益就会减少,并且与任务级回归共存。作为一次性压缩开销,LORE-KV 在六个密集和混合注意力的 骨干模型 上产生了 1.46-2.77 倍 AnDPro 的每个样本挂钟时间。

LORE-KV:以 Monte Carlo 估计 KV 缓存驱逐代价:论文原图
图 8:NIAH 检索。在 $B{=}1024$ 的 Llama-3.1-8B-Instruct 上跨针深度和 4K-32K 上下文的精确匹配和单词 召回率 分数。面板平均值显示在每个图的上方。