论文

TGV-KV:视觉语言模型的基于文本的 KV 驱逐

TGV-KV: Text-Grounded KV Eviction for Vision-Language Models

模型推理KV Cache

摘要

视觉语言模型 (VLM) 继承自回归生成范例,并缓存所有先前标记的键和值 (KV) 以加速推理,从而导致内存消耗随上下文长度线性扩展。由于视觉模态存在大量冗余,这个问题在 VLM 中尤其明显。尽管 KV 缓存驱逐方法可以有效减少推理内存,但它们通常会导致 VLM 性能显着下降,因为大多数都是为语言模型设计的,忽略了文本和视觉之间的固有差距。通过系统地分析本工作中 VLM 的模态差距,我们认为视觉信息的重要性应该基于文本指导,并相应地提出了一种基于文本的 VLM 驱逐方法(TGV-KV)。 TGV-KV包括三个子模块:(1)文本视觉预算(TVB)基于相互信息交互为每一层分配预算。 (2)文本加权排名(TWR)评估文本的优先级,并根据加权文本图像注意力对视觉重要性进行排名。 (3)文本优先保留(TPR)策略策略性地保留文本KV以避免严重的信息丢失。我们在具有不同大小和架构的五个模型上评估 TGV-KV,结果表明 TGV-KV 在使用 LLaVA-NeXT 的 VizWiz-VQA 任务中保留了 99.2% 的全 KV 准确率,并将端到端吞吐量提高了 52.6%,极端保留预算为 5%。代码可在 https://github.com/Danielement321/TGV-KV 获取。