论文
超越多样性:视觉标记修剪作为高效 VLM 的子空间重建
Moving Beyond Diversity: Visual Token Pruning as Subspace Reconstruction for Efficient VLMs
摘要
尽管视觉语言模型(VLM)具有出色的性能,但由于大量的视觉标记,它会产生大量的计算开销。虽然多样性最大化已成为词元减少的主要策略,但现有方法依赖于基于余弦的归一化相似性,该相似性会丢弃幅度信息,无法忠实地近似原始特征表示并导致性能不佳,特别是在组合多技能推理任务上。在本文中,我们介绍了 SPARE,一种子空间重建方法,它将标记修剪重新表述为列子集选择问题,并显式地最小化重建误差。通过迭代选择具有大投影残差的标记,SPARE 执行超越角度多样性的重建驱动修剪。此外,我们揭示了一种违反直觉的反相关性现象:图像-文本相关性得分较低的标记可以更好地保留上下文信息。基于这一发现,我们将反相关性纳入 SPARE 作为附加选择标准,以促进上下文感知词元选择。跨多个 VLM 和基准的大量实验表明 SPARE 始终实现最先进的性能,在组合任务上取得了巨大的进步。当应用于 LLaVA 时,SPARE 删除了高达 94% 的视觉标记,同时保留了 95% 的基准性能,所有这些都以完全 无需训练 的方式进行。