论文

SlimVLM:具有自适应视觉标记选择的灵敏度感知动态结构化修剪,可实现高效视觉语言模型

SlimVLM: Sensitivity-aware Dynamic Structured Pruning with Adaptive Visual Token Selection for Efficient Vision-Language Models

摘要

虽然视觉语言模型 (VLM) 在处理和理解文本和图像方面表现出了卓越的性能,但其较大的参数大小会导致大量的计算开销,从而限制了它们在资源有限的设备上的部署。虽然修剪对于压缩 大语言模型 (LLM) 非常有效,但直接将其应用于 VLM 会导致性能显着下降,这主要是由于冗余视觉标记干扰了重要性估计。为此,我们提出了 SlimVLM,这是一种结构化修剪框架,旨在压缩 VLM,同时保持其任务性能。我们为 VLM 引入了一种自适应视觉标记选择策略,该策略利用平均文本到视觉注意力分数来评估视觉标记的重要性,在基于设定阈值的修剪过程中删除冗余标记,从而优化重要性计算。认识到不同模块对稀疏性的不同容忍度,我们还提出了一种敏感度感知的动态剪枝机制,通过计算剪枝和未剪枝模块的输出之间的线性重建误差来确定每个模块的适当剪枝比率,确保整体性能稳定性。实验结果表明,SlimVLM 在多个多模式基准测试中优于现有方法,实现了最先进的性能。