论文
大型视觉语言模型中的多图像视觉标记修剪
Multi-Image Visual Token Pruning in Large Visual Language Models
摘要
随着现实世界应用中处理多个图像序列的需求不断增长,出现了各种视觉标记修剪方法,以减轻大视觉语言模型(LVLM)面临的计算和上下文长度限制。然而,大多数现有的剪枝方法依赖于静态策略,这些策略很难适应不同架构的 LVLM 和多图像场景,并且还受到它们对注意力计算的依赖的限制,而注意力计算与 FlashAttention 等高效技术不兼容。为了解决这些限制,我们提出了 无需训练,自适应视觉词元修剪(AVTP)框架,适用于各种 LVLM 架构。我们根据对各种 LVLM 的视觉注意力分布的实证分析,策略性地确定剪枝层,并在多图像环境中实现自适应剪枝比率,其中重要性较高的图像按比例保留更多标记。我们在不同的 LVLM 上进行了广泛的实验,以证明 AVTP 的有效性和鲁棒性。具体来说,Qwen3VL-8B 在多个多图像基准测试中实现了 2 倍的推理加速,同时保持了原始精度的 96.1%,InternVL3.5-8B 保留了 94.1% 的精度,LLaVA-OV-7B 甚至超过了其原始基准性能。我们的代码可在 \href{https://github.com/zry13/AVTP}{this link} 获取。