论文

MuCRASP:感知多模态思维链推理的结构化剪枝

MuCRASP: Multimodal Chain-of-thought Reasoning aware Structured Pruning

摘要

视觉语言模型(VLM)日益依赖思维链(CoT)推理来解决复杂多模态任务,但其庞大的参数规模使部署成本高昂。结构化剪枝提供了一种自然的解决方案;然而,现有方法无法在VLM中保持CoT推理精度。我们找出两个关键原因:(1) CoT一致性依赖于生成轨迹中稀疏的转折点(pivot token),而现有剪枝方法对CoT不敏感;(2) 为单模态LLM设计的剪枝方法未考虑视觉与文本模态之间激活分布的差异。基于这些观察,我们提出MuCRASP,一个结构化剪枝框架:在全局参数预算下瞄准推理关键组件,同时保持跨模态对齐并考虑逐层敏感性。在四个VLM、三个推理基准上的实验表明,MuCRASP在压缩率不断提高时仍能持续保持推理质量。在Qwen2.5-VL-7B上剪枝30%时,MuCRASP在物理推理任务上取得8.87的LLM-as-a-Judge分数,而最强基线为7.32。此外,MuCRASP在高达50%剪枝率下仍保持高推理一致性,显著优于已有剪枝方法,同时困惑度退化更低。

MuCRASP:感知多模态思维链推理的结构化剪枝:论文配图
图 1:μ\muCRASP 概述。梯度归因和轨迹枢轴归因提供互补的剪枝信号,这些信号使用剪枝比率相关系数 γdyn\gamma_{\text{dyn}} 进行融合。每层跨模式依赖(CMDS)和输出敏感性定义了一个保护因子 pfp_{f},该因子在积极修剪下保留视觉语言集成层。贪婪背包求解器使用生成的重要性分数在注意力头和 MLP 神经元之间分配全局修剪预算,同时强制执行最小保留约束。