论文

并非所有注意力头都有助于关键的视觉标记选择:头部感知修剪更重要

Not All Attention Heads Contribute to Critical Visual Token Selection: Head-Aware Pruning Matters More

模型推理推理加速

摘要

视觉语言模型 (VLM) 在不同的视觉场景中表现出了令人印象深刻的性能。然而,这一成功是以视觉标记的爆炸性增长为代价的,这在推理过程中带来了大量的内存和计算开销,最终增加了延迟。为了提高 VLM 推理效率,一类典型的视觉标记修剪方法通过聚合 大语言模型 (LLM) 主干修剪层中所有头的注意力分数来估计标记重要性,并根据聚合分数修剪标记。然而,在本文中,我们揭示了一个引人注目的现象:精确定位关键视觉标记的能力集中在一小部分头部。专门针对这些头进行聚合可以提高任务性能。受这一观察的启发,我们提出了 ProViP,一个 无需训练 渐进式视觉标记修剪框架。 ProViP 首先在 LLM 主干推理之前根据输入标记的嵌入相似性删除冗余视觉标记,然后在推理过程中通过头部感知修剪进一步修剪标记。实验表明,ProViP 具有出色的任务性能和推理效率。例如,当应用于 LLaVA-1.5-7B 时,ProViP 保留了原始性能的 95.9%,并在 88.9% 的剪枝率下实现了 1.62 倍的推理加速。