论文
匹配的结果,不同的目光:与人类相比,注视点 MLLM 的搜索情况如何
Matched Outcomes, Divergent Gaze: How Foveated MLLMs Search Compared to Humans
摘要
人类视觉搜索是连续的:中央凹必须落在候选者上以确认它,并且这些着陆形成扫描路径。多模态 大语言模型 (MLLM) 在给定相同的注视点输入的情况下,是否能像人类一样进行搜索,这取决于它们作为人类视觉模型的用途和注意力对准分数。我们在目标导向搜索 (COCO-Search18) 上比较了三种通用 MLLM 与人眼运动扫描路径,通过相同的、与人类匹配的注视点视图固定来驱动每个模型固定,并沿着三个轴对其进行评估:目标存在的决策、到达目标的效率以及注视过程本身。轴分离。在决策和目标获取方面,模型匹配或超过人类,检测到天花板附近的当前目标,并比人类更频繁地在第一次扫视时到达目标。凝视过程不是人类的。在人类匹配的条件下,这三个人共享一个特征:低熵、大振幅、自洽的扫描路径,其与自身的一致性远远超过两个人彼此之间的一致性。这与单通道、非串行架构一致,而不是敏锐度的限制。匹配的视网膜输入再现了人类观看的位置,但不再现观看如何及时展开,并且没有退化机制能够恢复类人搜索的成功。差距位于答案对齐和显着性指标无法衡量的流程轴上。因为他们错过了这一点,所以这些指标无法证明类人视觉,并且零样本模型适合结果和空间问题,但不适合时间、过程级别的问题。