论文
视觉语言模型的协作多模式修剪
Collaborative Multi-Mode Pruning for Vision-Language Models
摘要
视觉语言模型 (VLM) 在统一的 Transformer 架构中取得了快速发展,但由于计算复杂性较高,它们在资源受限的设备上的部署仍然具有挑战性。虽然剪枝已成为压缩 VLM 的有效技术,但现有方法主要通过剪枝参数或词元来关注单一模式,忽略了充分探索每种模式中固有的冗余,这导致高剪枝率下性能大幅下降。为了解决上述限制,我们提出了协作多模式修剪(CoMP),这是一种通过执行联合参数和词元修剪来为 VLM 量身定制的新颖框架。具体来说,我们首先设计一个协作重要性度量(CIM)来研究耦合参数和词元之间的相互干扰。它将标记的不同重要性纳入参数重要性分数的计算中,同时减轻修剪参数对标记重要性分数的影响。此外,我们开发了一种多模式剪枝策略(MPS),它将整个剪枝过程分解为一系列剪枝阶段,而在每个阶段,我们根据剪枝成本估计不同剪枝模式的优先级,并自适应地转向最优剪枝模式。此外,MPS结合了历史成本和随机探索,以实现稳定的剪枝过程并避免局部最优。跨各种视觉语言任务和模型的广泛实验表明,与最先进的方法相比,我们的方法有效地提高了高剪枝率下的性能。源代码可在 https://github.com/Wuzimeng/CoMP.git 获取。