论文
人类的第六感:多模态模型直觉视觉推理评测
Humanity's Sixth Sense: Benchmarking Intuitive Visual Reasoning in Multimodal Models
摘要
人类从场景中感知到的信息远超画面直接呈现的内容:一眼便能推断此前的原因和未来的走向;快速观察便能判断车辆是否能穿过两辆停放汽车之间的空隙;几秒视频便能识别谁在房间里掌握权威;短片中也能看出不成文的规则或隐藏标签等抽象模式。这体现了一种类似人类“第六感”的直觉推理机制,能够从原始感官信息中推断隐含内容。这种快速、零样本的视觉直觉支撑着日常导航和社会交往,也是与人协作的多模态大语言模型(MLLM)所需的重要能力。然而,现有视觉基准主要关注学术和数学领域的专家级分析,或较低层次的感知,较少测试人们日常进行的直觉推理。为此,我们提出Humanity's Sixth Sense(HSS),一个直觉视觉推理基准。HSS涵盖多种图像和视频输入,采用结构化分类组织题目,并为每项输入配备人工编写的提示,考察人们一眼即可推断的时间、空间、社会和抽象结构。前沿MLLM的表现明显低于人类:人类参与者准确率达到93.1%,最强模型GPT-6-astra即使采用最大推理强度也仅达到53.6%。当前模型虽擅长许多需要高级感知和知识的复杂任务,却仍难以完成这些对人类直观的视觉任务。我们进一步研究了采用动态视觉操作的Agentic配置,它能缩小差距,但尚不能消除差距。HSS将直觉视觉推理确立为可测量的能力维度,并将关注点引向当前基准上的规模扩展尚未充分改善的能力。
