论文
LVLM 能否揭示视觉错觉背后的真相?感知和推理能力分析
Can LVLMs Uncover the Truth Behind Visual Illusions? An Analysis of Perceptual and Reasoning Capabilities
摘要
大视觉语言模型具有集成推理能力,将认知性能提升到新的水平。然而,现有的评估要么只关注感知,要么依赖数学或编码等特定领域。仍然需要评估与开放世界环境相一致的推理能力,特别是联合考虑感知和推理的能力。为了弥补这一差距,我们建议通过利用视觉错觉作为诊断工具来评估 LVLM。视觉错觉是人类视觉系统误解客观信号,导致理解偏离现实的现象。我们构建了幻觉推理,这是从现实世界收集的幻觉图像的基准,包含各种带注释的问题答案对。基于幻觉推理,我们表明各种 LVLM 的推理能力并不像声称的那么先进。我们的工作为 LVLM 提供了新的见解,并提供了未来的优化方向。我们的项目已公开发布于 https://github.com/zhaoliangjie55/EMNLP2026_Illusion。