论文
MI-Pruner:用于高效 MLLM 的跨模式互信息引导词元剪枝器
MI-Pruner: Crossmodal Mutual Information-guided Token Pruner for Efficient MLLMs
摘要
对于多模态 大语言模型 (MLLM),与文本相比,视觉信息相对稀疏。因此,针对高效推理的视觉剪枝研究应运而生。当前的方法通常根据视觉编码器或 LLM 解码器中的注意力分数来测量词元重要性,然后选择具有高注意力分数的视觉词元,同时修剪其他词元。在本文中,我们寻求一种不同的、更具手术性的方法。我们不依赖特定于机制的信号,而是在视觉和文本特征交互之前直接计算它们之间的互信息(MI)。这使我们能够在特征级别上明确地测量跨模式依赖性。我们的 MI-Pruner 简单、高效且非侵入性,不需要访问内部注意力图或架构修改。实验结果表明,我们的方法优于以前基于注意力的修剪方法,并且延迟最小。