论文
TOPS:经构建token最优保留集的第一性原理视觉token剪枝
TOPS: First-Principles Visual Token Pruning via Constructing Token Optimal Preservation Sets for Efficient MLLM Inference
摘要
多模态大语言模型(MLLM)已取得强多模态推理能力——但其效率受大量视觉token限制——引入可观计算开销。视觉token剪枝提供自然解法——但既有方法不完美:基于注意力的标准倾向保留冗余token——而基于多样性的标准常对用户指令无感知。即使组合多标准的方法也缺乏对token剪枝内在目标的有原则形式化。本文中——我们从第一性原理重审视觉token剪枝——把它形式化为构建token最优保留集。经自顶向下的信息论分析——我们识别有效token选择的三个基本原则:任务相关性、信息覆盖与语义多样性。基于这些原则——我们提出TOPS——免训练、模型无关的剪枝模块——可应用于多种MLLM。在7个MLLM骨干与14个基准上的大量实验表明TOPS在多样剪枝设定下超越先前方法。值得注意的是——在LLaVA-NeXT上——TOPS移除77.8%视觉token——同时在其7B与13B模型上分别保持100.0%与100.6%性能——提示剪除冗余视觉token有时可缓解幻觉——并启发未来轻量MLLM设计。
