论文
QEvict:用于注意力漂移鲁棒长上下文解码的可恢复量化 KV 驱逐
QEvict: Recoverable Quantized KV Eviction for Attention-Drift-Robust Long-Context Decoding
摘要
自回归 大语言模型 推理越来越受到键值 (KV) 缓存的内存占用的限制。主要工作线通过驱逐在注意力衍生分数下显得不重要的词元来减少这种足迹。然而,这样的政策做出了一个隐含的不可逆转的决定:一旦词元被移除,它就不能再次变得有用。我们证明这种假设在解码过程中是脆弱的。随着生成的查询的发展,词元和窗口重要性发生变化,导致标准驱逐策略永久丢弃后来在全缓存模型下受到大量关注的状态。为了描述这种行为,我们引入了未来错过的质量和全局 LIR,这两种诊断方法可以衡量分配给废弃状态的未来注意力以及历史不活跃区域的重新激活。我们提出了 QEvict,一种三层 KV 缓存管理方案,用可恢复驱逐取代二进制保留或删除驱逐。 QEvict 以全精度维护高置信度窗口,将中间窗口存储在量化的可恢复层中,并仅删除最低置信度窗口。在解码过程中,累积注意力分数会更新窗口重要性,当量化窗口再次变得重要时,它会被反量化并提升到全精度。在固定的内存预算下,这种设计保留了更广泛的历史背景,同时保留了最重要区域的准确完整精度。在长上下文理解、检索和推理基准中,QEvict 持续改进代表性逐出和量化基线,减少注意力缺失并提高信息保留