论文
GOTS:面向高分辨率视觉-语言模型的贪心正交词元选择
GOTS: Greedy Orthogonal Token Selection for High-Resolution Vision-Language Models
摘要
现代视觉-语言模型(VLM)日益依赖动态或高分辨率视觉编码,产生数千个视觉词元,显著增加下游语言模型的推理成本。现有词元缩减方法通过逐词元重要性、查询相关性、覆盖率、成对多样性或子集级目标来评估词元效用。我们的关键洞见是从所选跨度的互补性视角看待视觉词元缩减:不再孤立地为单个词元打分或通过成对关系评估,而是衡量其特征与已保留子集的跨度有多少正交成分。基于这一视角,我们提出贪心正交词元选择(GOTS),一种免训练且与查询无关的方法。在每一步,GOTS选择与当前已保留跨度正交的残差能量最大的词元。该规则精确最大化候选加入中的一步增广Gram行列式,为每次贪心步骤的子集扩张提供精确的局部几何保证。在来自Qwen-VL与InternVL家族的五个高分辨率VLM骨干以及十一个多样基准上,GOTS取得了比所评估最强基线更高的平均性能保持率;一项受控的OCRBench研究显示,在计入选择开销之后,它还降低了模型侧的time-to-first-token(首词元时间)。代码见 https://github.com/newLLing/GOTS。
