论文

E2S-Pruner:用于视觉语言模型中视觉标记修剪的渐进两阶段证据融合

E2S-Pruner: Progressive Two-Stage Evidence Fusion for Visual Token Pruning in Vision-Language Models

模型推理推理加速

摘要

视觉语言模型通常将图像编码为数百个视觉标记,从而产生大量的推理延迟和 GPU 内存开销。现有的修剪方法很大程度上依赖于注意力分数,并直接聚合注意力头和网络层的输出,这使得难以表征证据的不确定性和冲突。我们提出了 E2S-Pruner,这是一种用于视觉标记修剪的渐进式两阶段证据融合框架,不需要辅助模型、可训练参数或 微调。在第一阶段,E2S-Pruner将每个注意力头视为独立的证据源,从证据清晰度和头间一致性来估计其可靠性,并使用重要、不重要和不确定三种状态来表示每个视觉标记。第二阶段,使用Dempster-Shafer证据理论来量化层间冲突并融合来自多个网络层的互补证据。我们进一步引入了空间新颖性约束,该约束可以促进不同图像区域的覆盖并防止保留的标记集中在一些局部显着区域。在 LLaVA-1.5-7B 上,当保留的视觉词元的平均数量分别为 192、128 和 64 时,E2S-Pruner 保留了 98.0%、96.8% 和 90.6% 的总体性能,同时在 128 个词元和 64 个词元设置下将吞吐量提高了 1.96 倍和 2.09 倍。 Qwen2-VL-7B 上的实验进一步证明了跨模型泛化。代码可在 https://github.com/taoyu-qian/E2S-Pruner.git 获取。