论文

大视觉语言模型的结构剪枝:剪枝动力学、恢复和数据效率的综合研究

Structural Pruning of Large Vision Language Models: A Comprehensive Study on Pruning Dynamics, Recovery, and Data Efficiency

摘要

虽然大视觉语言模型 (LVLM) 展示了令人印象深刻的功能,但其大量的计算和内存要求对资源受限的边缘设备提出了部署挑战。当前的参数缩减技术主要涉及从小语言模型训练 LVLM,但这些方法提供的灵活性有限并且计算量仍然很大。我们研究了一条补充路线:通过对语言模型主干应用结构化剪枝来压缩现有的 LVLM,然后进行轻量级恢复训练。具体来说,我们研究了两种结构剪枝范式:分层剪枝和宽度剪枝,并将它们与 logits 和隐藏状态上的监督微调和 知识蒸馏 配对。此外,我们还评估了仅使用一小部分可用数据进行恢复训练的可行性。我们的结果表明,宽度剪枝通常在计算资源有限或微调数据不足的低资源场景中保持更好的性能。至于恢复训练,在小压缩水平下仅微调多模式投影仪就足够了。此外,监督微调和隐藏状态 蒸馏 的组合可以在各种修剪级别上产生最佳恢复。值得注意的是,仅使用5%的原始数据即可实现有效恢复,同时保留超过95%的原始性能。通过对从 3B 到 7B 参数的三个代表性 LVLM 系列的实证研究,本研究为从业者提供了可操作的见解,以在没有大量计算资源或足够数据的情况下压缩 LVLM。代码库位于 https://github.com/YiranHuangIrene/VLMCompression.git。