论文
TReVS:集成文本相关性和视觉显着性以实现高效的视觉语言模型标记修剪
TReVS: Integrating Textual Relevance and Visual Saliency for Efficient Vision-Language Model Token Pruning
摘要
视觉语言模型 (VLM) 擅长视觉理解和推理,但由于大量的视觉标记,常常会产生大量的推理成本。最近的视觉标记修剪方法越来越遵循两阶段范式:它们首先在视觉编码器之后删除视觉冗余标记,然后丢弃与大语言模型(LLM)内的文本查询无关的标记。然而,由于第一阶段通常仅依赖于视觉编码器显着性,因此它可能会过早地消除与查询相关的标记,从而剥夺后续文本引导阶段的关键视觉证据。我们的实证分析表明,将查询指导纳入第一阶段剪枝可以更好地保留与任务相关的证据,并持续提高基于视觉显着性剪枝的性能。我们进一步发现,高方差注意力头对文本查询更敏感,并为第二阶段修剪产生更具辨别力的文本到视觉注意力信号。受这些发现的启发,我们提出了 TReVS,这是一种免训练框架,它将文本相关性与视觉编码器显着性相结合,用于 LLM 预剪枝,并利用高方差注意力头来删除 LLM 浅层到中层的与任务无关的标记。在 LLaVA-1.5-7B 上,TReVS 保留了 92.8% 的未剪枝基线性能,同时剪枝了 94.4% 的视觉标记,优于之前最先进的方法。