论文

ReDiPrune:用于高效多模态的相关性-多样性预投影词元修剪 LLM

ReDiPrune: Relevance-Diversity Pre-Projection Token Pruning for Efficient Multimodal LLMs

摘要

最近的多模态 大语言模型 的计算成本很高,因为 Transformer 必须处理大量视觉标记。我们提出了 ReDiPrune,一种在视觉语言投影仪之前应用的 无需训练 词元修剪方法,其中视觉特征仍然丰富且具有辨别力。与对压缩表示进行操作的投影后修剪方法不同,ReDiPrune 直接从视觉编码器输出中选择信息标记,保留细粒度的空间和语义线索。每个标记都通过轻量级规则进行评分,该规则共同考虑文本条件相关性和最大最小多样性,确保所选标记既与查询相关又非冗余。 ReDiPrune 完全即插即用,无需重新训练或架构修改,并且可以无缝插入编码器和投影仪之间。在四个视频和五个图像基准测试中,它持续改进了准确性与效率的权衡。例如,在使用 LLaVA-NeXT-Video-7B 的 EgoSchema 上,仅保留 15% 的视觉标记即可获得 +2.0% 的绝对准确度增益,同时以 TFLOP 计算减少超过 6\times$ 的计算量。代码可在 https://github.com/UA-CVML/ReDiPrune 获取。