论文
当视觉变成文本:通过 VLM 中的跨模态残差指导进行视觉标记修剪
When Vision Becomes Text: Visual Token Pruning via Cross-Modal Residual Guidance in VLMs
摘要
丰富的视觉信息增强了视觉语言模型(VLM)感知,但大量的视觉标记提高了推理成本。现有的视觉标记修剪方法依赖于基于相似性的指导,该指导利用成对的文本视觉和视觉视觉标记相关性进行压缩。然而,此类方法仅捕获局部层级信号,而忽略了 VLM 中的整个推理过程。在本文中,我们重新审视了 VLM 推理,并提出了一种新的有效指导方案来补充基于相似性的指导。特别是,我们发现了一个关键的观察结果:随着 LLM 层的加深,文本标记通过自注意力不断聚合视觉信息,并逐步将部分视觉内容吸收到文本表示中。为了量化这种现象,我们从几何表示的角度提出了跨模态吸收(CMA)来衡量文本吸收了多少视觉信息,揭示了更深层次的更多视觉标记可以通过文本子空间来近似解释。因此,我们提出了跨模态残差(CMR)。它通过吉洪诺夫正则化最小二乘法将视觉标记投影到文本子空间上,并利用重建残差来量化无法用文本解释的视觉信息。最后,基于 CMR,我们提出了 SIEVE,一种 无需训练 视觉标记压缩方法,它结合了 CMR、文本注意力相关性和残差空间多样性来保留任务相关和互补标记。不同VLM架构上的实验验证了SIEVE的有效性。例如,在 LLaVA-NeXT-7B 上,SIEVE 仅保留 $11.1\%$ 的视觉标记,同时保留 $97.5\%$ 的原始平均性能,实现 $3.62\times$ 预填充加速、$2.49\times$ 端到端加速以及 $6.02\times$ KV 缓存减少。