论文

最后但并非最不重要的一点:多模式 KV 缓存压缩的边界注意力校准

Last But Not Least: Boundary Attention CalibratiON for Multimodal KV Cache Compression

模型推理KV Cache

摘要

多模态 大语言模型 (MLLM) 实现了强大的视觉语言推理,但会导致较大的 KV 缓存和长视觉上下文的高解码延迟。现有的压缩方法依赖于观察窗口注意力来进行稳定的词元重要性估计,但这种聚合可能会稀释稀疏的关键证据并在激进的压缩下丢弃与答案相关的词元。我们将最后一个查询注意力识别为恢复此类证据的补充信号,尽管其不相关的信号可能会引入额外的噪声。我们提出了 BACON,一种即插即用的方法,可以使用最后的查询证据来校准观察窗口注意力,同时通过层内一致性和层间持久性来抑制噪声。在不同的基准、模型、预算和压缩方法中,BACON 在最激进的预算下将多模式 KV 缓存压缩平均提高了 7.5%,增益高达 30.9%。