论文
LRCP:低秩压缩性引导视觉词元修剪,实现高效 LVLM
LRCP: Low-Rank Compressibility Guided Visual Token Pruning for Efficient LVLMs
摘要
大型视觉语言模型(LVLM)实现了强大的多模态理解,但其推理成本随着视觉标记数量的增加而迅速增长,特别是对于高分辨率图像和长视频。现有的基于注意力的方法根据注意力分数来估计标记重要性,这可能会引入位置偏差,而基于表示的方法则根据特征关系或重建误差减少视觉冗余,忽略了视觉标记集的全局结构。在本文中,我们从低秩压缩性的角度重新审视视觉词元压缩。在模型和数据集中,我们观察到视觉标记表示表现出明显的低秩结构,即使在随机删除大部分标记后,主导子空间仍保持稳定。受这一发现的启发,我们提出了 LRCP,一种 无需训练 压缩框架,它首先通过 PCA 估计视觉标记的主要低秩子空间,然后通过每个标记在该子空间上的投影残差对其进行评分,保留低秩背景很难解释的标记。大量实验表明,LRCP 取得了优异的结果,保留了 94.7% 的原始图像理解性能,词元减少了 88.9%,平均视频理解准确率保持在 97.8%,词元减少了 87.5%。