论文

何时称苹果为红色:人类遵循内省规则,VLM 则不然

When to Call an Apple Red: Humans Follow Introspective Rules, VLMs Don't

模型评测基准与评测资源

摘要

了解视觉语言模型 (VLM) 何时会出现意外行为、模型是否能够可靠地预测自己的行为以及模型是否遵循其内省推理,这些都是可信部署的核心挑战。为了研究这一点,我们引入了分级颜色归因(GCA)数据集,这是一个受控基准,旨在得出决策规则并根据这些规则评估参与者 忠实性。 GCA 由线条图组成,这些线条图在三种条件下改变像素级颜色覆盖范围:世界知识重新着色、反事实重新着色和没有颜色先验的形状。使用 GCA,我们要求 VLM 和人类参与者声明一个阈值规则:必须是给定颜色的对象像素的份额才能接收该颜色标签。然后,我们将这些规则与随后的颜色归因决策进行比较。我们的研究结果表明,模型系统地违反了它们自己的内省规则。例如,对于具有强烈颜色先验的对象,GPT-5-mini 在近 60% 的情况下违反了其规定的内省规则。人类参与者仍然忠实于他们规定的规则,任何明显的违规行为都可以用有据可查的高估颜色覆盖率的倾向来解释。相比之下,我们发现 VLM 可以准确地估计颜色覆盖范围,但在最终响应中直接与它们自己的推理相矛盾。在引发内省规则的所有模型和策略中,世界知识先验以不反映人类认知的方式系统地降低 忠实性。我们的研究结果挑战了“VLM 推理失败是由困难驱动的”这一观点,并表明 VLM 内省的自我知识被错误校准,这对高风险部署有直接影响。