论文
积极观察者的考试
An Exam for Active Observers
摘要
人类视觉是一个闭环:视线不断地被中间假设而不是单个快照重定向。数十年的心理物理学和认知科学认为,这种积极的观察对于许多任务来说都是必不可少的。今天的多模态 大语言模型 (MLLM) 是否进行主动观察是一个实证问题,当前的视觉语言基准无法回答。我们引入了 ActiveVision,这是一个可以衡量 MLLM 主动观察的基准,包含 3 个类别的 17 项任务。任务旨在强制重复的视觉感知,而不是单一的静态描述。 Frontier MLLM 在 ActiveVision 上崩溃:我们评估的得分最高的模型,GPT-5.5,处于暴露的推理努力最高层,仅解决了 10.6% 的项目,并且在 17 项任务中的 11 项得分为零,甚至 Claude Fable 5,尽管在大多数推理和编码排行榜上名列前茅,也仅解决了 3.5%,远远落后于三个人类参与者的平均 96.1%。此外,即使模型编写并运行自己的视觉代码,大部分差距仍然存在:此类代码在现实图像上不可靠,并且捕获其故障本身需要模型缺乏的主动感知。总之,这些结果表明,当前的 MLLM 缺乏强大的主动视觉观察、激励架构和闭合感知推理循环的训练目标。