论文

(如何)MLLM 是否像人类一样报告双稳态图像?

(How) Do MLLMs Report Bistable Images Like Humans?

模型评测模型行为与机制分析

摘要

像鸭兔这样的双稳态图像是经典的刺激,其中一张图像支持多种相互不兼容的解释,通常在人类中一次报告一种解释。我们询问多模态大语言模型 (MLLM) 是否表现出类似的报告行为以及哪些内部计算支持它。使用 LLaVA 系列,我们研究了两个易于处理的维度:可调节性,即报告是否会因自下而上的视觉线索和自上而下的语言先验而产生偏差,以及排他性,即响应是否致力于单一解释。我们在规范的鸭兔和合成视觉字谜上进行了测试,以减轻记忆混乱。在行为上,视觉和语言操作都以与人类一致的方式系统地改变报告,而反应仍然主要是排他性的。从机制上讲,这些效应源于竞争的图像词元表示、自下而上和自上而下调制的不同路径,以及专有报告和对象计数编码之间的联系。代码和数据可在 https://github.com/rtakatsky/mllm-bistable-images 获取。