论文

重新路由,不要删除:视觉语言模型的可恢复视觉词元路由

Reroute, Don't Remove: Recoverable Visual Token Routing for Vision-Language Models

模型推理推理加速

摘要

视觉语言模型 (VLM) 将图像投射到数百到数千个视觉标记中,使得解码器推理在注意力计算和 KV 缓存内存中变得昂贵。现有的视觉标记减少方法很大程度上遵循排序和删除范式:它们对视觉标记进行评分,保留紧凑的子集,并永久丢弃其余的。我们证明这种不可逆的行为是脆弱的,因为视觉标记的重要性随着解码器深度的变化而变化;在某一阶段排名较低的词元可能会在后面的层中变得相关,特别是对于视觉定位敏感的查询。我们提出了 Reroute,一个 无需训练 插件,用可恢复的路由代替删除。在每个路由阶段,选定的视觉词元通过解码器块,而延迟词元绕过该阶段并在下一个路由决策时重新进入候选池。重新路由重用现有的注意力评分排名规则和阶段式调度,保留其增强的修剪方法的理论 TFLOP 和 KV 缓存预算类别。在 LLaVA-1.5 和 Qwen 主干上的 FastV、PDrop 和 Nüwa 变体中,重新路由可改善激进词元减少下的视觉定位,同时保持总体 VQA 性能。这些结果表明,VLM 词元减少不应仅被视为不可逆的修剪,还应被视为可恢复的路由。代码可以在这里找到:https://github.com/elmma/mllm-reroute/