论文
通过矫正失真提高视觉标记减少以实现高效的多模态 LLM 推理
Improving Visual Token Reduction via Rectifying Distortions for Efficient Multimodal LLM Inference
摘要
多模态 大语言模型 (MLLM) 的最新进展在视觉语言任务中取得了显着的成功,但大量视觉标记所产生的二次计算复杂性导致了严重的内存和延迟瓶颈。虽然视觉标记减少(VTR)策略已经被探索来减轻这种负担,但现有的方法忽视了完整序列和减少序列之间的位置和注意力一致性,导致了扭曲的表示。为此,我们提出了 RESTORE,一种新颖的 VTR 框架,可以在保持效率的同时纠正位置和注意力扭曲。具体来说,我们提出了一种简单而有效的校准方法,通过根据相对距离增加注意力权重来恢复失去的视觉注意力。我们还引入了一种独特的锚点选择来进行标记合并,以减少特征平均期间的信息丢失。多个基准的实验结果表明,我们的方法持续提高了各种缩减方法的准确性,在保持计算效率的同时实现了最先进的性能。项目页面位于 https://cvlab.yonsei.ac.kr/projects/RESTORE