论文

比较安全相关环境中的人类凝视和视觉语言模型注意力

Comparing Human Gaze and Vision-Language Model Attention in Safety-Relevant Environments

模型评测模型能力评测

摘要

人类视觉注意力在人们如何感知和应对包含潜在风险的环境方面发挥着重要作用。这项研究调查了大型视觉语言模型是否可以识别在安全相关环境中吸引人类注意力的场景相同区域。眼动追踪数据来自 10 名参与者,他们使用 Pupil Invisible 可穿戴眼镜观看了代表具有不同程度潜在风险的环境的 33 个场景图像。视线坐标被映射到刺激图像上,以生成人群平均的人类视线热图。与此同时,GPT-4o 通过 OpenAI 视觉应用程序编程接口 (API) 生成视觉注意力的空间预测,并将其转换为显着性图,以便与人类注视模式进行比较。使用四个互补指标评估人类凝视热图和模型生成的显着性图之间的空间对齐:Pearson 相关性 (r = 0.515 +- 0.117)、归一化扫描路径显着性 (NSS = 0.988 +- 0.323)、Kullback-Leibler 散度 (KL = 1.766 +- 0.844) 和接收器工作特征曲线下的面积Judd 公式(AUC-Judd = 0.806 ± 0.076)。与 Gemini Pro、Gemini Flash 和 Claude 的跨模型比较表明,所有模型都超过了 0.5 的 AUC-Judd 机会基线,并取得了正的 NSS 分数。根据四个指标中的三个,Gemini Pro 展示了最强的空间定位,而根据 KL 散度衡量,GPT-4o 产生了与人类注意力最接近的分布匹配。这些发现表明,大型视觉语言模型可以识别与安全相关场景中人类直接视觉注意力大致对应的区域,而无需眼动追踪训练数据。结果凸显了视觉语言模型作为近似人类注意力模式的可扩展工具的潜力。