论文

Mirage 探针:视觉模型如何伪造视觉理解

Mirage Probes: How Vision Models Fake Visual Understanding

模型评测模型行为与机制分析

摘要

视觉语言模型 (VLM) 可以自信地回答基于图像的问题,而且通常是正确的,即使没有提供图像也是如此。这种海市蜃楼行为会夸大基准分数,而不会反映视觉基础。先前的工作将此视为单一故障模式。我们认为是两个。使用 Mirage Probes(一种对比探测框架,将释义的问题变体与同一图像上匹配的海市蜃楼和非海市蜃楼标签配对),我们表明海市蜃楼行为可以从两个开源 VLM 中的残留流、MLP、后注意和注意头站点的内部激活线性解码。我们证明朴素贝叶斯文本基线无法恢复该信号,从而排除了表面词汇混淆。跨基准可分离性模式,加上一种新颖的先验利用指数(PHI),测量模型仅从文本中可以回答多少,暴露了两种不同的机制:文本偏差,模型根据语言先验进行回答,而不涉及视觉表示;以及虚假图像,它在潜在空间中构建了错误的视觉内容,并回答得好像有根据一样。这种区别具有直接的缓解后果:文本分布清理可以解决第一种情况,但无法达到第二种情况,因为虚假图像海市蜃楼存在于模型的视觉表示中,而不是其文本中。忠实的视觉基础需要在表征层面进行干预。