论文
CLASP:多模态的类自适应层融合和双级剪枝 大语言模型
CLASP: Class-Adaptive Layer Fusion and Dual-Stage Pruning for Multimodal Large Language Models
摘要
由于视觉标记序列中的高冗余,多模态 大语言模型 (MLLM) 遭受大量计算开销。现有方法通常使用单层 Vision Transformer (ViT) 功能和静态修剪策略来解决此问题。然而,这种固定配置在不同的指令下通常很脆弱。为了克服这些限制,我们提出了 CLASP,一种基于类自适应层融合和双阶段剪枝的即插即用词元缩减框架。具体来说,CLASP首先通过多层视觉特征融合构建特定类别的视觉表示。然后,它执行双阶段修剪,在关注显着枢轴标记(用于相关性)和冗余感知完成标记(用于覆盖)之间分配 词元预算。通过类自适应修剪,CLASP 可以实现即时调节的特征融合和预算分配,从而实现积极而稳健的视觉标记减少。大量实验表明,CLASP 在各种基准、剪枝比率和 MLLM 架构上始终优于现有方法。代码可在 https://github.com/Yunkaidang/CLASP 获取。