论文

DIVE:高效视觉语言模型的动态迭代视觉证据构建

DIVE: Dynamic Iterative Visual Evidence Construction for Efficient Vision-Language Models

模型推理推理加速

摘要

视觉语言模型(VLM)中的视觉输入通常被编码成比文本长得多的标记序列,这使得视觉标记成为高效推理的主要瓶颈。最近有大量方法通过对标记重要性进行评分并在一次传递中修剪低分标记来解决这一瓶颈。然而,一次性评分是不够的,因为词元的提示相关有用性取决于已经保留的证据。受这一见解的启发,我们引入了 DIVE(动态迭代视觉证据构建),这是一个 无需训练 框架,它将视觉词元修剪重新塑造为动态证据构建。 DIVE 重复选择具有最高残差条件分数的剩余标记,更新视觉和提示残差以折扣已经解释的证据,并重新评估剩余标记。这个选择-更新-重新评估过程构建了一组保留的补充的、与提示相关的证据。八个图像理解基准测试的实验表明,DIVE 在 词元预算 上始终保持性能。视觉标记减少了 88.9%,DIVE 保留了未压缩模型的 98.2% 的平均性能。代码可在 https://github.com/Zhong-Chenchen/DIVE.git 获取。