论文
LearnPruner:重新思考视觉语言模型中基于注意力的标记修剪
LearnPruner: Rethinking Attention-based Token Pruning in Vision Language Models
摘要
视觉语言模型(VLM)最近在视觉理解和推理方面表现出了卓越的能力,但由于长视觉序列输入,它们也带来了巨大的计算负担。最近的工作通过修剪不重要的视觉标记来解决这个问题,在保持模型性能的同时实现大量的计算减少。词元剪枝的核心在于确定词元重要性,当前的方法主要依赖于视觉编码器或 大语言模型 (LLM) 的注意力分数。在本文中,我们分析了视觉编码器和 LLM 中注意力机制的有效性。我们发现视觉编码器受到注意力下沉的影响,导致对信息丰富的前景区域的注意力不集中,而在 LLM 中,尽管先前的研究已经确定了对标记位置的注意力偏差,但文本到视觉的注意力表现出对这种偏差的抵抗力,并在中间层实现了有效的修剪指导。基于这些观察,我们提出了 LearnPruner,这是一个两阶段标记修剪框架,首先通过视觉编码器之后的可学习修剪模块删除冗余视觉标记,然后在 LLM 的中间层仅保留与任务相关的标记。实验结果表明,我们的 LearnPruner 可以在仅使用 5.5% 的视觉 token 的情况下保留大约 95% 的原始性能,并实现 3.2$\times$ 的推理加速,展示了卓越的准确性与效率权衡。