论文
StackTok:通过预算自适应视觉词元选择加速 VLM 推理
StackTok: Accelerating VLMs Inference with Budget-Adaptive Visual Token Selection
摘要
提高图像分辨率会在视觉语言模型(VLM)中产生越来越长的视觉标记序列,从而大大提高其推理成本。为了在不重新训练的情况下减少这种开销,现有方法选择紧凑的标记子集,这些子集优先考虑查询相关性、视觉覆盖率或它们之间的固定权衡。然而,适当的平衡因查询和词元预算而异:局部问题有利于相关性,而整体问题则需要更广泛的视觉覆盖范围。我们引入了 StackTok,这是一种免训练选择器,它将查询相关性视为目标,将视觉覆盖范围视为预算校准支持。 StackTok 从仅覆盖的贪婪序列构建大小索引的覆盖参考,并使用查询视觉亲和熵调整其支持目标。然后,参考门控交错选择策略根据当前子集的支持赤字在相关性和覆盖性导向的添加之间切换。对于高分辨率输入,StackTok 根据本地提名词元的综合边际收益在图像裁块之间分配一份共享词元预算。通过 5 个 VLM 超过 10 个不同的图像理解基准进行评估,StackTok 在每个测试模型(预算设置)的免训练选择器中排名第一。在高分辨率 LLaVA-NeXT-7B 上,它仅使用 2{,}880 (5.6%) 个视觉标记中的 160 个就保留了 95.26% 的完整标记性能。