论文
ID-Selection:基于重要性多样性的视觉标记选择,实现高效 LVLM 推理
ID-Selection: Importance-Diversity Based Visual Token Selection for Efficient LVLM Inference
摘要
最近的进展探索了视觉标记修剪,以加速大型视觉语言模型(LVLM)的推理。然而,现有的方法常常难以平衡词元重要性和多样性:基于重要性的方法往往保留冗余词元,而基于多样性的方法可能会忽略信息丰富的词元。在高缩减率下,这种权衡变得尤其成问题,其中仅保留视觉标记的一小部分是至关重要的。为了解决这个问题,我们提出了 ID-Selection,这是一种简单而有效的 token 选择策略,用于高效的 LVLM 推理。关键思想是将重要性估计与多样性感知迭代选择结合起来:首先为每个标记分配一个重要性分数,然后逐一选择高分标记,同时逐步抑制相似标记的分数。通过这种方式,ID-Selection 保留了信息标记,同时减少了统一选择过程中的冗余。跨 5 个 LVLM 主干和 16 个主要基准的大量实验表明,ID-Selection 始终能够实现卓越的性能和效率,尤其是在极端剪枝率下。例如,在 LLaVA-1.5-7B 上,ID-Selection 修剪了 97.2% 的视觉标记,仅保留 16 个标记,同时将推理 FLOP 减少了 97% 以上,并保留了 91.8% 的原始性能,所有这些都无需额外训练。