论文
凝视注意力:用于高效多模式的查询自适应视觉路由 LLM
Gaze Attention: Query-Adaptive Visual Routing for Efficient Multimodal LLMs
摘要
当人类描述视觉场景时,他们不会统一处理整个图像;相反,他们有选择地关注与其预期描述相关的区域。相比之下,当前的多模态 大语言模型 (MLLM) 关注所有视觉标记,导致焦点分散和不必要的计算开销。现有的效率方法通常在生成之前压缩或丢弃视觉信息,可能会丢失后续预测所需的细节。在这项工作中,我们引入了 Gaze Attention,这是一种使 MLLM 能够根据每个生成步骤的需要选择视觉区域的机制。通过将视觉标记分组到空间区域并选择与当前预测相关的标记,凝视注意力减少了注意力计算,同时专注于相关的视觉内容。我们进一步引入可学习的上下文标记来总结图像或视频帧,在选择性注意下保留全局上下文。对 13 个图像和 6 个视频理解基准的实验表明,Gaze Attention 匹配或超过密集注意力基线,同时使用的视觉 KV 条目减少了 90%。在匹配的视觉 KV 预算下,它还实现了比 KV 缓存驱逐基线更高的平均性能。