论文

通过随机设计进行 KV 缓存驱逐的错误证书

Error Certificates for KV-Cache Eviction via Randomized Design

模型推理KV Cache

摘要

确定性 KV 缓存驱逐将 top-$k$ 词元保持在重要性分数之下,并删除其余的词元,删除后,服务系统无法知道当前查询的驱逐成本是多少。我们用已知包含概率的泊松采样替换确定性尾部,这使得驱逐误差可识别,并将保留集上的调查采样方差估计器转变为每个保留标记一个额外标量的每步误差证书。在压缩到 10\% 缓存预算的 30 回合助手上,证书门控系统回答了 0.97 次召回问题,而对于 top-$k$ 则为 0.09 次;对于之前陈述的 26 到 30 回合的事实,它召回了 97\%,而对于 2\%。我们证明,根据确定性方案保留的信息计算出来的估计器对于其自身的驱逐误差来说是一致的:可以改变驱逐值,以便保留的所有内容都保持不变,而真正的注意力输出误差则无限制地增长。在泊松设计下,证书涵盖了 12{,}096 个重放单元中 96.9--97.7\% 的已实现注意力误差,以及 12 个其他架构中 98.1--99.7\% 的已实现注意力误差。随机化购买归因,而不是预测:在 LongBench 上以 6k 和 16k 词元(约 74{,}000 代)进行的预注册研究发现,问题感知驱逐在 25--50\% 预算下几乎免费,输出对数概率是更好的故障预测器,而证书回答了问题置信度不能的问题,将 AUC 0.65--0.75 处的驱逐引起的固有故障与固有故障区分开来。 0.47--0.54,并以随机门控增益的 1.7--1.8 倍安排重新计算。在真正的长期对话中,门控系统返回严重损坏状态内的完整缓存分数,并且触发它的规则在五个模型系列中是相同的。