论文
VisualFLIP:预测是否依赖于多模态推理中的任务关键型视觉证据?
VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?
摘要
当多模态 大语言模型 正确回答视觉推理问题时,任务关键型视觉证据是否真正支持该预测?正确的答案可能与有缺陷的推理共存,使得准确性本身成为不完整的基础测试。我们引入了 VisualFLIP,这是一个配对基准,包含 1,374 张图像,这些图像排列为跨基数、属性、空间和逻辑任务的相同问题扰动对。每对都保持问题固定,但对证据的改变最小,因此参考答案确定性地翻转。我们评估了 24 个 MLLM 的对精度(这需要求解一对的两侧)和崩溃率(CR),它测量解决至少一侧的模型对两幅图像重复相同的非空答案的频率。总之,这些指标表明成对的正确性和证据依赖性相关但又不同:在任务关键型视觉变化之后,有能力的模型仍然无法更新,并且当编辑的图像遵循顺序设置中的早期答案时,某些模型的崩溃变得更加严重。更多详细信息请访问我们的项目页面:https://didizhu-judy.github.io/VisualFLIP/