论文

看见还是知道?多模态中的视觉上下文敏感性 大语言模型

Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models

模型评测模型行为与机制分析

摘要

多模态 大语言模型 (MLLM) 通过将视觉输入与预训练语言模型的丰富先验相集成,实现了强大的性能。然而,他们经常在以视觉为中心的任务上失败,特别是当视觉证据与预先训练的知识发生冲突时。我们使用两种诊断范式分别探讨这些失败:(1)通过图像重建探测视觉信息是否可用,(2)测量多模态上下文敏感性,即模型遵循视觉上下文与先验语言的程度。为了支持第二个,我们引入了 WhatIfVis,一个跨越五个粗粒度维度(时空、颜色、计数、大小和重量)的基准,其问题承认来自图像或先验的答案。我们的分析得出三个结果:(i) 保留了粗粒度的视觉证据,因为这些属性可以从冻结 MLLM 的最终层图像标记中重建。因此,有关这些属性的问题的失败指向感知后的利用,而不是感知过程中视觉编码的退化。 (ii) 即使明确指示使用或忽略视觉证据,普通模型(WhatIfVis 上没有监督的 微调)也表现出不稳定的视觉上下文敏感性。受监督的 微调 (SFT) 提高了这种可控性并跨领域泛化,而激活补丁进一步在所有六个模型的架构特定深度上本地化了视觉与先验的权衡。 (iii) 愿景与先验的权衡是沿着学习向量可控的。即使没有任何意图指令,应用此转向向量也可以提高普通模型的可控性。总之,这些结果重新定位了瓶颈,表明对于我们研究的粗略属性,MLLM 对视觉证据进行编码,但无法可靠地控制对其的依赖。