论文
诊断视觉语言模型中的视觉无知
Diagnosing Visual Ignorance in Vision-Language Models
摘要
视觉语言模型 (VLM) 在许多视觉问答基准上实现了高精度,但目前尚不清楚这种准确性是否反映了问题所依赖的视觉细节的可靠使用。我们通过视觉无知的视角来审视这种张力:模型可以表示与任务相关的视觉证据而不用它来确定答案的情况。在三个 VLM 和 12 个基准测试中,我们跟踪每个解码器层可解码的与答案相关的信息,并测量它何时与最终输出耦合。正确答案所需的视觉证据已经可以从中间层读出,但直到解码器的最后层为止,它对输出影响很小。因果残差互换证实,改变答案需要晚期状态,而不是早期状态。然后,我们在渐进高斯模糊下评估所有十二个基准,发现大部分预测在整个退化序列中幸存下来,同时继续获得基准信用。这些结果区分了视觉信息的可用性及其对预测的影响,并表明标准精度可以与对测试的视觉细节的有限敏感性共存。它们激励训练和评估,使与答案相关的视觉区分成为正确回答所必需的。