论文
视觉语言模型中视觉信息流的路径
Pathways of Visual Information Flow in Vision-Language Models
摘要
我们研究视觉信息如何在视觉语言模型(VLM)中路由。在受控合成和自然数据集上使用因果修补,我们发现模型依赖于两种不同的途径来解决视觉任务:直接途径,其中视觉信息保留在图像标记表示中,并由后面层的最终标记读出;以及文本介导的途径,其中视觉信息首先传输到查询标记,然后由最终标记读出。在三个视觉任务中,我们表明路径选择是任务相关的,并且数据分布和提示设计也可以调节使用哪个路径来解决基于图像的查询。此外,使用注意力剔除和损坏的输入修补,我们发现这些路径是灵活的,在某些干预下,当通常的路径被消除时,模型可以依赖文本介导的路径作为后备。这种行为统一了之前工作的发现,并表明基于消融的干预措施可以揭示模型可以做什么,而不是它们通常做什么。总之,我们的结果提供了 VLM 中视觉信息流的机械特征,并强调了干预下其内部机制的灵活性。