论文

阅读正确,回答错误:视觉配置变化如何影响 VLM 中的证据使用

Reading Right, Answering Wrong: How Visual Configuration Changes Affect Evidence Use in VLMs

模型评测模型行为与机制分析

摘要

视觉语言模型 (VLM) 在视觉问答等任务上取得了出色的性能,但较小的图像大小调整可能会将正确答案变成错误。我们研究视觉配置的变化(例如图像平铺和标记排列)是否会导致这种不稳定。在七个检查点和四个基准测试中,同样小的调整大小会在切换配置时导致更多的正确性翻转。令人惊讶的是,在超过一半的情况下,模型错误地回答了问题,但在被告知要阅读什么时仍然可以阅读正确的答案。此外,LLaVA-NeXT 中的注意力干预表明,配置变化可能会削弱回答过程中可读信息的使用。因此,我们使用现场提示和模型自己的转录来指导模型。借助注释帮助,这些形式的指导通过可读信息总共纠正了 97.2% 的错误。这些发现表明,配置更改可能会影响模型使用它们仍然可以读取的信息的方式。