论文
SepPrune:基于分离器的高效多模态剪枝框架 大语言模型
SepPrune:A Separator-based Pruning Framework for Efficient Multimodal Large Language Models
摘要
最近的多模态 大语言模型 (MLLM),例如 Qwen2.5-VL 和 InternVL3,为高分辨率输入生成大量视觉标记,从而导致大量的计算成本。现有的视觉词元修剪方法要么依赖于跨模态注意力并且无法在预填充阶段之前进行修剪,要么依赖于计算开销较高的多样性估计。我们观察到视觉和文本标记的注意力分数在模态分隔符标记处达到峰值,表明这些分隔符桥接了两种模态。基于这一观察,我们提出了 SepPrune,一种高效的 无需训练 即插即用修剪方法,它使用分隔符标记作为统一查询来排序和选择信息丰富的视觉标记。 SepPrune 重用 LLM 的内置投影参数,无需进行架构更改。在 Qwen2.5-VL-7B 上的实验表明,SepPrune 实现了最先进的性能,保留了 96.3% 的原始准确率,同时去除了 80.2% 的视觉标记。