论文
ReFIT:自适应视觉Token精简加速图像理解
Adaptive Visual Token Reduction for Accelerated Image Understanding
摘要
大型视觉语言模型实现了强大的 VQA 性能,但处理高分辨率、信息丰富的图像需要大量计算,从而促进了视觉标记的减少。然而,现有的方法经常修剪单个标记或依赖于固定大小的裁剪,限制了它们保留空间结构化信息(例如水平或垂直拉长文本)的能力。为了解决这个限制,我们提出了 ReFIT,一种用于高效 LVLM 推理的指令引导视觉标记缩减框架。 ReFIT 由相关性引导窗口重塑 (RWR) 和指令引导标记细化 (ITR) 组成,其中 RWR 通过适应指令相关区域的空间特征来捕获指令相关区域,而 ITR 进一步删除不必要的视觉标记。对四个 VQA 基准的实验表明,ReFIT 提高了答案准确性,同时降低了计算成本,定性结果证明了其在定位相关区域和删除不必要的视觉信息方面的有效性。
