论文

检索头能看到图像吗?长上下文视觉语言模型中的多模态检索头

Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models

模型评测模型行为与机制分析

摘要

大型视觉语言模型越来越依赖长上下文建模来对文档、小时级视频和长视野代理轨迹进行推理,要求它们在交错的文本和图像中查找相关证据。先前的工作已经使用 大语言模型 中的检索头研究了这种行为,但当证据出现在图像中时,其基于副本的标准并不直接适用。我们引入了一种多模式检索头检测方法,该方法将注意力从问题标记转移到文本或视觉证据。通过这种方法,我们表明多模态检索头是稀疏的、内在的和因果重要的:只有 4.4-10.2% 的注意力头占正检索得分质量的 50%,并且屏蔽前 5% 的选定头会使 MMLongBench 的两项任务的性能降低 42.5 和 62.3 个百分点,而随机头屏蔽的破坏性要小得多。进一步的分析表明,这些头部在不同模态之间部分共享,但在每种模态内保持动态,随着上下文长度和干草堆模态的变化,图像检索头的变化比文本检索头的变化更大。无需进一步训练,我们发现这些头也可以直接用于对视觉丰富的文档进行排名:在 MMDocIR 上,Qwen3-VL-8B 选择头评分将 Recall@1 页面检索的宏/微观点提高了 7.7/7.4 点,将布局检索的布局检索点提高了 6.3/6.8 点。