论文
立场:视觉推理中系统性缺乏能动性
Position: The Systemic Lack of Agency in Visual Reasoning
摘要
本文认为,系统性缺乏代理限制了当前视觉语言模型(VLM)的隐式推理能力。内隐推理是指自主发现和利用隐藏的视觉证据来弥合信息差距的能力,而不是仅仅依赖于明确指定的目标。这种能力是人类视觉理解和日常推理的基础。我们认为,这种限制源于一种将视觉推理主要视为被动语义检索的倾向,而不是依赖于自主视觉探索的主动、情境推理。因此,大多数现有基准主要评估被动能力,而这方面的推理基本上没有得到衡量。为了解决这一差距,我们引入了视觉隐式推理诊断基准(V-IRD),它通过要求模型严格通过自主视觉分析来得出答案来针对这个缺失的象限。我们的结果表明,尽管检索能力很强,但著名的 VLM 很难利用参考对象并关注需要自我引导查询的视觉证据。简而言之,强大的语义识别并不等于主动的视觉探索,这揭示了当前 VLM 的关键差距。更多信息可以在 https://haoychen.github.io/Implicit-Reasoning/ 找到