论文

ReFIT:自适应视觉Token精简加速图像理解

Adaptive Visual Token Reduction for Accelerated Image Understanding

模型优化模型推理应用与实践推理加速剪枝通用理解与问答

摘要

大型视觉语言模型实现了强大的 VQA 性能,但处理高分辨率、信息丰富的图像需要大量计算,从而促进了视觉标记的减少。然而,现有的方法经常修剪单个标记或依赖于固定大小的裁剪,限制了它们保留空间结构化信息(例如水平或垂直拉长文本)的能力。为了解决这个限制,我们提出了 ReFIT,一种用于高效 LVLM 推理的指令引导视觉标记缩减框架。 ReFIT 由相关性引导窗口重塑 (RWR) 和指令引导标记细化 (ITR) 组成,其中 RWR 通过适应指令相关区域的空间特征来捕获指令相关区域,而 ITR 进一步删除不必要的视觉标记。对四个 VQA 基准的实验表明,ReFIT 提高了答案准确性,同时降低了计算成本,定性结果证明了其在定位相关区域和删除不必要的视觉信息方面的有效性。

ReFIT:自适应视觉Token精简加速图像理解:论文原图
图1:ReFIT整体架构。给定输入图像和指令,RWR 自适应地重塑窗口配置以定位与指令相关的区域,然后对这些区域进行裁剪和重新编码以实现细粒度的视觉表示。 ITR 使用指令引导的相关性图进一步删除裁剪区域内不必要的视觉标记,并将剩余标记转发给 LLM 进行答案生成。