论文

AsymVLM:用于高效视觉语言模型推理的非对称词元修剪

AsymVLM: Asymmetric Token Pruning for Efficient Vision-Language Model Inference

模型推理推理加速

摘要

视觉语言模型 (VLM) 处理每个图像数千个视觉标记以及相对较少的文本标记,但现有的压缩方法统一处理这两种模式。我们观察到这两种模式具有根本不同的属性:视觉标记在空间上是冗余的并且在预填充中占主导地位,而文本标记是因果相关的并且在解码过程中累积。基于这种不对称性,我们提出并实证评估 AsymVLM,它在预填充之前使用学习的重要性评分器和每个样本自适应预算对视觉标记进行积极的修剪,并且仅当文本标记超过固定预算时才基于时间阈值逐出文本标记。我们的实验表明,AsymVLM 在最先进的方法中实现了最高的 FLOP 节省(高达 54%),同时在视觉信息空间本地化和查询特定的文档和图表理解任务上比现有方法高出 2--3%,并在整体基准上保持有竞争力的准确性。在文本为主的场景中,我们的逐出策略通过适应 VLM 的短上下文性质,大大优于标准 LLM 缓存压缩方法。