论文

先聚焦再上下文:视觉语言模型的以主题为中心的渐进式视觉标记减少

Focus-then-Context: Subject-Centric Progressive Visual Token Reduction for Vision-Language Models

模型推理推理加速

摘要

视觉语言模型(VLM)面临推理过程中大量视觉标记序列产生的计算成本过高的瓶颈。现有的视觉标记减少方法减轻了这种负担,但它们无意中保留了与用户查询严格一致的孤立视觉主题,这无法充分探索显着主题及其上下文关系。在本文中,我们提出了 SPpruner,一种以主题为中心的渐进归约范式,它模拟人类视觉感知系统的 \textit{Focus-then-Context} 机制。具体来说,我们首先构建一个焦点识别模块来显式建模视觉显着性和语义相关性之间的相互作用。在这里,它可以挖掘全面的视觉主题谱,以确保视觉输入的高保真表示。随后,开发了上下文感知结构扫描模块来聚合来自邻近区域的上下文线索。因此,它可以有效地恢复全局关系依赖关系,以维护所保存主题的结构完整性。大量实验表明,我们的范式始终优于 SOTA 方法,在 Qwen2.5-VL 中仅保留 22.2% 的视觉标记,实现了高达 2.53 倍的加速,在 LLaVA 上减少了 67% 的 FLOPs,且准确率下降了 0.6%,可以忽略不计。