论文
S$^2$Prune:多模态的空间结构化视觉标记修剪 大语言模型
S$^2$Prune: Spatially Structured Visual Token Pruning for Multimodal Large Language Models
摘要
视觉标记修剪通过仅保留视觉标记的子集来减少多模式 大语言模型 (MLLM) 的推理开销。现有的方法通常根据重要性或冗余性来选择标记。然而,我们观察到这些标准在输入之间产生稳定的空间偏差,并且并不总是优于简单的均匀网格采样,凸显了广泛空间覆盖的价值。受此启发,我们提出了 S$^2$Prune,这是一种 无需训练 修剪方法,可以保留空间覆盖范围,同时使标记密度适应局部图像结构。我们首先将图像划分为多个区域,并为每个区域分配至少一个标记以保留覆盖范围。剩余的 词元预算 然后根据拉普拉斯变分进行分配,为结构更丰富的区域提供更多的词元。然后,我们使用从第一个解码器块计算出的早期表示变化(ERC)来选择每个区域内的代表性词元。我们在不同的设置和两种 MLLM 架构中评估 S$^2$Prune。在Qwen2.5-VL-7B-Instruct上,它在评估的无需训练剪枝方法中达到了最高的平均精度。仅用原始 576 个视觉标记中的 32 个,仍然保留了全模型性能的 79.3%。代码可在 https://github.com/yuanyuanjia71-spec/S2Prune 获取。