论文
为什么我们看向我们所看的地方:注视点视觉语言模型的类人固定,最大限度地提高场景理解
Why We Look Where We Look: Emergent Human-like Fixations of a Foveated Visual Language Model Maximizing Scene Understanding
摘要
当人类在没有特定任务(自由观看)的情况下观看场景时,他们最初将眼球运动指向场景中心,然后关注人、文本、被注视或抓握的物体以及语义上有意义的区域。这些特征固定模式反映了什么以及它们是否优化了潜在的感知任务仍然未知。我们展示了具有模拟注视点的计算代理,经过训练以优化场景理解,表现出新兴的人类注视特征模式。相比之下,经过训练来搜索或分类场景,或者配备了比人类视觉更好或更差的周边视觉的智能体版本,预测人类注视模式的准确度较低。因此,人类自由观看的注视模式可能会作为在中央凹视觉的生物约束下优化场景理解的功能副产品而出现。