论文

修剪一次:视觉语言模型的无需再训练的与任务无关的修剪

Prune Once: Retraining-Free Task-Agnostic Pruning for Vision-Language Models

摘要

视觉语言模型 (VLM) 通过大规模 预训练 在不同的多模态任务中实现了显着的泛化,但其快速增长的计算和内存需求对受限环境中的部署提出了重大挑战。现有的剪枝策略通常依赖于特定于任务的标准或面向 LLM 的重要性度量,这使得它们不适合与任务无关的剪枝,其中在剪枝时没有特定于任务的样本可用,并且剪枝的模型仍然广泛适用。我们引入了一种名为 PORTA 的免再训练 VLM 修剪框架,该框架基于激活变化导出与任务和模态无关的重要性公式,从通用校准数据估计,该公式可靠地捕获跨模态的特征级表示效用。 PORTA还结合了自适应稀疏性分配机制,该机制根据输出特征的可变性分配分层剪枝率,避免了均匀稀疏性的限制并减少了高压缩级别下的性能下降。跨 VLM 架构(例如 CLIP、BLIP 和 Qwen2-VL)的大量实验表明,PORTA 在高稀疏性下实现了有竞争力的下游性能,无需任何重新训练,支持高效的 VLM 压缩。代码可在 https://github.com/cau-hai-lab/PORTA.git 获取。