论文
P2P:从修补到剪除VLM的视觉计算
From Patching to Pruning Visual Computation in Vision Language Models
摘要
视觉语言模型(VLM)推理成本高昂,因为每个视觉token都要被每个解码器层的注意力与MLL投影处理——即使许多深度处不需要token特定的视觉计算。我们提出受机制可解释性启发的Patch-to-Prune(P2P)——训练自由框架,把激活修补从诊断工具转化为推理时计算绕过:执行验证引导的前向与反向层扫描,识别其视觉token投影输出可在用户指定精度容差内被固定中性代理激活向量替换的解码器区域。与传统token剪枝不同,P2P保持序列长度、token顺序、位置信息、注意力掩码与残差通路——在不移除token或修改预训练权重的情况下剪除计算。在Qwen2.5-VL与LLaVA族四个VLM、七个多模态基准(校准/验证/测试互斥划分)上评估:3%容差下P2P保留约94%稠密准确率并降低55% FLOPs。效率之外,逐层分析提示VLM的视觉处理跨解码深度非均匀分布:早层与晚层常只需极少token特定视觉计算,而中间层承担大部分任务相关的视觉整合,使后续推理主要依赖已嵌入共享残差与文本表示的视觉信息。这使P2P既是高效推理框架也是VLM视觉信息处理的因果透镜。