论文

KVCapsule:具有不对称冗余的视觉语言模型的高效顺序 KV 缓存压缩

KVCapsule: Efficient Sequential KV Cache Compression for Vision-Language Models with Asymmetric Redundancy

模型推理KV Cache

摘要

视觉语言模型 (VLM) 已成为 大语言模型 (LLM) 的关键且快速增长的扩展,可通过文本和图像输入实现多模态推理。尽管VLM丰富了语言模型的能力,但它们也继承并放大了关键的计算瓶颈:自回归解码过程中大键值(KV)缓存带来的内存开销。这一挑战在 VLM 中尤为严峻,与文本相比,图像会产生更长的标记序列和更密集的特征表示。此外,视觉标记的空间和信息丰富性质引入了结构化注意模式,使得许多面向 LLM 的 KV 缓存压缩技术在直接应用于 VLM 时无效。在这项工作中,我们对视觉标记的行为进行了详细的实证分析,强调了与纯粹基于文本的模型的关键差异。基于这些见解,我们提出了 KVCapsule,一种用于视觉词元的新型 KV 缓存压缩框架。 KVCapsule 保持预训练的 VLM 主干冻结,无需修改注意力计算模块,并且可以通过轻量级压缩和重建组件集成到现有的 VLM 中。我们在多个 VLM 和基准任务上评估 KVCapsule,结果表明,在 60% 压缩比下,TPS 提高了 2 倍,KV 缓存内存减少了 2.4 倍,而准确性或响应质量的下降可以忽略不计。我们的研究结果提供了在内存预算有限的情况下扩展 VLM 推理的实用途径,并激发了对多模式模型的结构感知缓存压缩的进一步研究。