论文

EvoComp:通过语义引导进化标签学习多模态 大语言模型 的视觉词元压缩

EvoComp: Learning Visual Token Compression for Multimodal Large Language Models via Semantic-Guided Evolutionary Labeling

模型推理推理加速

摘要

最近的多模态 大语言模型 (MLLM) 在视觉语言理解任务上表现出了强大的性能,但其推理效率往往受到大量视觉标记的阻碍,特别是在高分辨率或多图像场景中。为了解决这个问题,我们提出了 EvoComp,一种视觉词元压缩框架,可以显着减少词元数量,同时保持任务准确性。 EvoComp 引入了一种基于 Transformer 的轻量级压缩器,该压缩器通过联合考虑视觉和文本上下文来选择信息最丰富且非冗余的视觉标记。核心挑战在于为压缩机训练提供有效的监督。为此,我们设计了一种进化标记策略,用于搜索标记子集,最大限度地减少 MLLM 的输出损失,同时通过基于词汇的标记分组来增强语义多样性。我们使用定制的损失函数进一步训练压缩器,结合 GHM 损失来减轻类别和难度不平衡,并使用余弦相似性正则化来鼓励保留和丢弃的标记之间的语义分离。跨多个视觉语言基准的大量实验表明,EvoComp 优于基于注意力或相似性启发法的现有方法。值得注意的是,它在 3 倍词元压缩下保留了 99.3% 的原始精度,并在移动设备上提供高达 1.6 倍的加速。