论文
EvoCut:用于高效大型视觉语言模型的多层进化感知视觉词元压缩
EvoCut: Multi-Layer Evolution-Aware Visual Token Compression for Efficient Large Vision-Language Models
摘要
大型视觉语言模型(LVLM)在图像和视频理解任务上实现了强大的性能,但其推理效率受到视觉编码器产生的大量视觉标记的限制。大多数现有的视觉标记压缩方法根据特定层的注意力分数或表示属性来估计标记的重要性,而忽略了视觉标记在视觉编码器中的演变方式。这种特定于层的标准可能提供不完整的重要性估计并限制压缩后的性能保留。为了解决这个问题,我们分析了逐层视觉词元演化方向,并观察到词元在视觉编码器层上形成多个组演化方向。我们的分析进一步表明,信息标记往往表现出与共同群体进化方向的持续偏差。基于这一观察,我们提出了 EvoCut,一种 无需训练 和无注意力视觉标记压缩方法,可根据多层进化偏差估计标记重要性。实验结果表明,EvoCut 在 LLaVA-1.5-7B 上仅保留了 11.1% 的视觉标记,同时保留了 94.4% 的平均性能,证明了其在平衡效率和准确性方面的有效性。