论文

让您的 LVLM KV 缓存更加轻量级

Make Your LVLM KV Cache More Lightweight

模型推理KV Cache

摘要

键值 (KV) 缓存已成为现代大型视觉语言模型 (LVLM) 推理的事实上的组件。虽然它提高了 大语言模型 (LLM) 中的解码效率,但由于预填充阶段需要处理大量视觉词元,因此在 LVLM 中直接采用会带来大量 GPU 内存开销。为了解决这个问题,我们提出了 LightKV,这是一种通过利用视觉词元嵌入之间的冗余来减少 KV 缓存大小的新颖方法。在文本提示的引导下,LightKV 采用跨模态消息传递来聚合视觉词元中的信息消息,并在预填充期间逐步压缩它们。这种提示感知指导将我们的方法与之前的仅视觉压缩策略区分开来。我们在八个公共基准数据集(例如 MME 和 SeedBench)的八个开源 LVLM 上评估 LightKV。实验结果表明,仅使用原始视觉词元的 55%,LightKV (a) 将视觉词元 KV 缓存大小减半,(b) 将计算量减少多达 40%,(c) 保留通用性能,同时显着优于现有基线。