论文
剪枝前居中:LVLM 中基于多样性的视觉词元剪枝的轻量级几何校正
Centering before Pruning: Lightweight Geometry Correction for Diversity-Based Visual Token Pruning in LVLMs
摘要
大型视觉语言模型 (LVLM) 由于其视觉标记序列长且高度冗余,会产生大量推理成本。基于多样性的剪枝通过基于成对余弦相似度选择标记子集来减轻这种成本。然而,我们发现原始视觉标记之间的相似性强烈集中在正范围内,限制了它们区分非冗余标记的能力。提高此分辨率的自然方法是在计算余弦相似度之前将标记特征居中。居中确实揭示了更丰富的成对结构,但单独使用时却意外地降低了修剪性能。我们表明,出现这种明显的矛盾是因为原始几何图形不仅仅代表成对多样性:它还隐含地支持全局独特的标记,这些标记往往包含语义信息内容。居中更好地解决了子集多样性,但失去了这种有用的标记偏好,揭示了多样性和独特性与原始几何图形纠缠在一起。基于此分析,我们提出了 \textbf{Cen-Prune}r (Cen-Prune),它使用中心余弦相似度来测量子集多样性,同时保留原始空间的独特性作为互补的标记偏好。这种轻量级、即插即用的校正使底层选择机制保持不变,并且产生的计算开销可以忽略不计。跨多个图像和视频理解基准以及 LVLM 架构的广泛实验表明,Cen-Prune 在现有基于多样性的剪枝器中提供了整体性能的稳健改进。