论文

SinkPruner:多模态的无接收器视觉词元修剪 大语言模型

SinkPruner: Sink-Free Visual Token Pruning for Multimodal Large Language Models

模型推理推理加速

摘要

尽管多模态理解能力很强,但多模态 大语言模型 (MLLM) 在处理长视觉标记序列时会产生大量计算开销。为了降低推理成本,最近的研究通过以视觉为中心或文本引导的策略探索了视觉标记修剪。然而,这些方法经常忽略高范数异常标记,即具有异常大特征范数的标记,从而导致次优的修剪决策。在这项工作中,我们表明,这种高范数异常标记在特征和空间维度上都高度冗余,但经常被现有方法错误地保留为信息线索。受这一观察的启发,我们提出了 SinkPruner,这是一种用于高效 MLLM 推理的 无需训练 视觉标记修剪框架。 SinkPruner 遵循从粗到精的设计,有两个关键模块:一个视觉清理器,用于过滤高范数冗余并减轻注意力下沉和注意力分散;以及一个文本引导修剪器,进一步保留与文本查询语义一致的标记。对十二种图像语言和四种视频语言基准的广泛实验证明了我们框架的有效性、效率和通用性。值得注意的是,SinkPruner 在词元减少 89% 的情况下保留了 LLaVA-1.5 (Qwen2.5-VL) 原始性能的 96.5% (91.8%)。实验进一步表明,我们的视觉消毒剂在增强现有修剪方法的性能方面表现出良好的可转移性。我们的代码可在 https://github.com/LaVi-Lab/SinkPruner 获取。