论文

表示动态揭示了 MLLM 中视觉标记修剪的语义显着性和相似性

Representation Dynamics Reveal Semantic Saliency and Similarity for Visual Token Pruning in MLLMs

摘要

多模态大语言模型 (MLLM) 会因长视觉标记序列而产生较高的推理延迟。现有的修剪方法通常使用注意力图或输出特征来估计词元重要性或冗余。最近的几种方法也利用了表示变化,但是这些变化何时以及如何反映前景显着性和语义一致性仍然没有得到充分理解。我们分析了编码器深度上的视觉标记表示动态并发现了两个发现。首先,词元更新幅度和前景显着性之间的关系是层相关的:大词元更新集中在两个深度间隔中的前景区域,由中间深度的几个接收器主导的层分隔开。其次,词元更新方向之间的相似性比编码器输出特征之间的相似性更好地区分同一类和不同类词元。基于这些发现,我们提出了 MSDG-Prune,这是一种无需训练的方法,它使用更新幅度和方向来保留显着且多样化的视觉信息。具体来说,我们通过更新方向相似性对标记进行分组,并使用从所选深度窗口的更新幅度派生的查询加权显着性进行分组标记修剪。四个 MLLM 的广泛实验证明了 MSDG-Prune 的有效性和通用性。在 LLaVA-NeXT 上,它平均保留了 91.9% 的未压缩性能,仅需要 5.6% 的视觉标记,同时实现了 7.8 倍的预填充加速。代码可在 https://github.com/liweixuan-hitsz/MSDG-Prune. 获取