论文

MentisOculi:揭示基于心理意象推理的局限

MentisOculi: Revealing the Limits of Reasoning with Mental Imagery

模型评测基准与评测资源

摘要

前沿模型正从仅摄取视觉信息的多模态大语言模型(MLLM),转向具备原生交错生成能力的统一多模态模型(UMM)。这一转变引发了把中间可视化用作推理辅助的兴趣,类似于人类的心理意象。这一想法的核心,是以目标为导向形成、保持并操纵视觉表示的能力。为评测并探查这一能力,我们构建了MentisOculi,一套程序化生成、分层的多步推理问题套件,这些问题可通过视觉方式求解,并经过调校以挑战前沿模型。通过评测从潜空间token到显式生成图像等多种视觉策略,我们发现它们总体上无法提升性能。对UMM的专门分析揭示了一个关键局限:尽管它们具备解决任务的文本推理能力,有时也能生成正确的视觉内容,却受制于不断累积的生成误差,甚至无法利用真值可视化。我们的发现表明,尽管视觉思维颇具吸引力,但它尚未惠及模型推理。MentisOculi为跨多个模型族分析并弥合这一差距奠定了必要基础。

MentisOculi:揭示基于心理意象推理的局限
图17:Gemini 2.5-I 在各任务上动作提议与显式视觉状态更新之间的耦合并不均衡。图中为提议动作(x 轴)与生成图像(y 轴)的联合分布。虚线表示 x=y;对角线之上的值暗示存在额外图像(例如回溯),而对角线之外的散布则表明逐动作的状态追踪不一致。