论文

TOPS:经构建token最优保留集的第一性原理视觉token剪枝

TOPS: First-Principles Visual Token Pruning via Constructing Token Optimal Preservation Sets for Efficient MLLM Inference

摘要

多模态大语言模型(MLLM)已取得强多模态推理能力——但其效率受大量视觉token限制——引入可观计算开销。视觉token剪枝提供自然解法——但既有方法不完美:基于注意力的标准倾向保留冗余token——而基于多样性的标准常对用户指令无感知。即使组合多标准的方法也缺乏对token剪枝内在目标的有原则形式化。本文中——我们从第一性原理重审视觉token剪枝——把它形式化为构建token最优保留集。经自顶向下的信息论分析——我们识别有效token选择的三个基本原则:任务相关性、信息覆盖与语义多样性。基于这些原则——我们提出TOPS——免训练、模型无关的剪枝模块——可应用于多种MLLM。在7个MLLM骨干与14个基准上的大量实验表明TOPS在多样剪枝设定下超越先前方法。值得注意的是——在LLaVA-NeXT上——TOPS移除77.8%视觉token——同时在其7B与13B模型上分别保持100.0%与100.6%性能——提示剪除冗余视觉token有时可缓解幻觉——并启发未来轻量MLLM设计。

TOPS:经构建token最优保留集的第一性原理视觉token剪枝:论文配图
图 2:200 个 MME 样本上跨词元预算 (128/64/32) 的剪枝方法的 Logit 保真度。我们报告 Δ​ℒ=ℒpruned−ℒvanilla\Delta\mathcal{L}=\mathcal{L}_{\text{pruned}}-\mathcal{L}_{\text{vanilla}},其中较低的值表示较小的输出失真。 TOPS 始终实现最低的损失增加,在积极修剪下表现出更强的保真度。