论文

DIPrune:以双重重要性进行任务感知视觉词元剪枝

DIPrune: Task-Aware Token Pruning with Dual Importance for Efficient Multimodal Language Models

模型优化稀疏化

摘要

最近的多模态大语言模型 (MLLM) 的 无需训练修剪方法通过利用视觉冗余或文本视觉注意力有效地减少了计算开销。然而,由于任务无关的设计或不可靠的注意力估计,它们经常遭受语义退化。根据我们的实证分析,我们发现这个问题的出现是因为浅层中的显着 token 通过数值惯性持续抑制新出现的语义,导致过早丢弃对深层推理至关重要的信号。为了解决上述问题,从面向任务的方面出发,我们首先将 无需训练剪枝重新表述为最小化最终任务损失中的失真,并导出一个易于处理的 token 上限作为 代理模型 目标。具体来说,这个公式本质上揭示了一个先前被忽略的层间项,它解释了跨层的梯度。因此,为了实现,我们提出了 DIPrune,一种基于排名的框架,采用双重重要性评分机制来联合优化层内静态特征显着性和层间动态语义演化。 LLaVA 和 Qwen-VL 上的大量实验表明,DIPrune 始终取得最先进的结果。

DIPrune:以双重重要性进行任务感知视觉词元剪枝:论文原图
图 4:DIprune 框架概述。 (a) 管道说明了多模态编码过程(左)和特定层的剪枝操作(右)。 (b-d) DIPrune 机制:双重重要性评分设计,捕获 (c) 层间动态语义演化并评估 (d) 层内静态特征显着性。两个分数共同用于选择最优的top-$K$ token。