论文
MWOP:用于高效 MLLM 的模态感知宽度操作修剪
MWOP: Modality-aware Width-wise Operation Pruning for Efficient MLLMs
摘要
多模态大语言模型 (MLLM) 在处理长视觉文本序列时会产生大量推理成本。虽然现有的操作压缩方法利用模态级冗余,但它们主要将注意力头和共享前馈网络(FFN)通道内的计算视为统一单元,从而导致更细粒度的冗余尚未得到充分探索。我们发现,同一注意力头内的模态交互路径以及同一 FFN 通道的视觉和文本执行之间的冗余度有所不同。基于这些发现,我们提出了模态感知宽度操作修剪(MWOP),它独立地修剪每层内的视觉到视觉(V2V)、文本到视觉(T2V)和文本到文本(T2T)注意路径,并分别为视觉和文本输入选择FFN通道。一阶泰勒准则指导剪枝过程,在注意力剪枝和基于 LoRA 的恢复训练之后重新评估 FFN 重要性。为了将由此产生的细粒度稀疏性转化为实际加速,我们进一步开发了路径稀疏 Triton 注意力内核和紧凑的视觉侧 FFN 执行。 MWOP 保留了 token 序列,同时减少了注意力和 FFN 计算,使其成为 token 压缩的补充,并能够同时减少序列长度和每个 token 的计算。在 LLaVA-OneVision-7B 上,仅 MWOP 就实现了 $1.6\times$ 预填充加速,在 12 个基准测试中平均性能保留率为 99.7%。结合两种代表性的词元压缩方法,其预填充速度分别从 $2.0\times$ 和 $1.9\times$ 提高到 $2.9\times$ 和 $2.7\times$。 Qwen2.5-VL-7B 的结果进一步证明了其跨架构的适用性。该代码可在 https://github.com/EIT-NLP/MWOP. 获取