论文

GOTS:面向高分辨率视觉-语言模型的贪心正交词元选择

GOTS: Greedy Orthogonal Token Selection for High-Resolution Vision-Language Models

模型推理推理加速

摘要

现代视觉-语言模型(VLM)日益依赖动态或高分辨率视觉编码,产生数千个视觉词元,显著增加下游语言模型的推理成本。现有词元缩减方法通过逐词元重要性、查询相关性、覆盖率、成对多样性或子集级目标来评估词元效用。我们的关键洞见是从所选跨度的互补性视角看待视觉词元缩减:不再孤立地为单个词元打分或通过成对关系评估,而是衡量其特征与已保留子集的跨度有多少正交成分。基于这一视角,我们提出贪心正交词元选择(GOTS),一种免训练且与查询无关的方法。在每一步,GOTS选择与当前已保留跨度正交的残差能量最大的词元。该规则精确最大化候选加入中的一步增广Gram行列式,为每次贪心步骤的子集扩张提供精确的局部几何保证。在来自Qwen-VL与InternVL家族的五个高分辨率VLM骨干以及十一个多样基准上,GOTS取得了比所评估最强基线更高的平均性能保持率;一项受控的OCRBench研究显示,在计入选择开销之后,它还降低了模型侧的time-to-first-token(首词元时间)。代码见 https://github.com/newLLing/GOTS。

GOTS:面向高分辨率视觉-语言模型的贪心正交词元选择:论文配图
图 1:拟议的贪婪正交令牌选择概述。输入图像由Vision Transformer (ViT)编码;使用生成的视觉编码器特征执行标记选择,以保留信息丰富的视觉标记。在每次迭代 t=0,…,K−1t=0,\dots,K-1 中,选择过程执行三个关键步骤:(1)选择具有最大残余能量的标记,(2)计算归一化基向量,以及(3)通过正交投影更新所有剩余候选向量的残差。