论文

推理模型的价值感知随机 KV 缓存驱逐

Value-Aware Stochastic KV Cache Eviction for Reasoning Models

模型推理KV Cache

摘要

推理模型通过扩展思维链提高准确性,但其长输出会造成内存和计算瓶颈。 KV 缓存驱逐方法通过从缓存中驱逐不重要的键值对来降低成本,但它们通常比基于选择的稀疏注意力替代方案(保留完整的 KV 缓存)产生更差的准确性。我们确定了对 KV 缓存驱逐准确性至关重要的关键因素。首先,一小部分值状态具有异常大的幅度,驱逐它们会导致模型进入重复推理循环的灾难性失败。其次,在驱逐期间引入随机性通过增加缓存多样性来提高准确性。基于这些发现,我们提出了价值感知随机 KV 缓存逐出 (VaSE),这是一种 无需训练 配方,可保护大量值状态并促进多样化的逐出决策。在六个推理任务中,使用具有 4 倍 KV 缓存压缩的 VaSE 的 Qwen3 模型在相同稀疏度下比 SOTA 选择方法产生更高的平均精度,同时比最强驱逐方法高出 4% 以上。总体而言,VaSE 弥合了效率和准确性之间的差距,支持 FlashAttention2 并为推理模型提供静态内存占用。