论文

人类的第六感:多模态模型直觉视觉推理评测

Humanity's Sixth Sense: Benchmarking Intuitive Visual Reasoning in Multimodal Models

模型评测基准与评测资源模型能力评测

摘要

人类从场景中感知到的信息远超画面直接呈现的内容:一眼便能推断此前的原因和未来的走向;快速观察便能判断车辆是否能穿过两辆停放汽车之间的空隙;几秒视频便能识别谁在房间里掌握权威;短片中也能看出不成文的规则或隐藏标签等抽象模式。这体现了一种类似人类“第六感”的直觉推理机制,能够从原始感官信息中推断隐含内容。这种快速、零样本的视觉直觉支撑着日常导航和社会交往,也是与人协作的多模态大语言模型(MLLM)所需的重要能力。然而,现有视觉基准主要关注学术和数学领域的专家级分析,或较低层次的感知,较少测试人们日常进行的直觉推理。为此,我们提出Humanity's Sixth Sense(HSS),一个直觉视觉推理基准。HSS涵盖多种图像和视频输入,采用结构化分类组织题目,并为每项输入配备人工编写的提示,考察人们一眼即可推断的时间、空间、社会和抽象结构。前沿MLLM的表现明显低于人类:人类参与者准确率达到93.1%,最强模型GPT-6-astra即使采用最大推理强度也仅达到53.6%。当前模型虽擅长许多需要高级感知和知识的复杂任务,却仍难以完成这些对人类直观的视觉任务。我们进一步研究了采用动态视觉操作的Agentic配置,它能缩小差距,但尚不能消除差距。HSS将直觉视觉推理确立为可测量的能力维度,并将关注点引向当前基准上的规模扩展尚未充分改善的能力。

人类的第六感:多模态模型直觉视觉推理评测:论文原图
图 2:跨四个域的 HSS 任务示例。每个面板显示输入媒体(单个图像或采样视频关键帧)、人工编写的问题、参考答案和评估标准。时间和因果动态:识别视频中手动轨道切换动作的物理结果。物理和空间逻辑:判断车辆是否可以容纳在两辆停放的轿车之间,而无需明确的刻度标记。社会理解:推断视频片段中一个人停止追赶公共汽车的原因。摘要和上下文推理:从相邻清晰标签的算术级数中推导出被遮挡的烧杯标签。