论文

着眼于 VLM:视觉语言模型中的视线追踪和社交视线预测基准测试

Eyes on VLM: Benchmarking Gaze Following and Social Gaze Prediction in Vision Language Models

模型评测模型能力评测

摘要

视觉语言模型(VLM)已迅速发展成为具有强大零样本泛化能力的通用多模态推理器。在这种情况下,VLM 可以极大地有利于人类凝视和注意力的分析,这是人类行为理解的核心任务,需要对物理场景以及活动、交互和社会背景进行推理。然而,VLM 能够在多大程度上可靠地理解人类凝视和相关的注意力行为,在很大程度上仍有待探索。在这项工作中,我们提出了 EyeVLM,这是一个跨两个互补维度(任务和模型)的 VLM 中凝视理解的系统评估框架。为了评估凝视理解能力,我们关注两个核心任务。第一个是凝视跟踪,即预测人正在注视的 2D 位置,具有几何和视觉处理焦点,需要精确理解人脸、注意力方向、3D 场景结构和关注目标的空间基础。第二个是社交注视预测,需要对多人交互进行社交和关系推理(例如,相互注视和共享注意力),并且可能会从 VLM 内的 LLM 语义推理功能中受益更多。关于模型,EyeVLM 通过两种方式评估这些任务:零样本设置,具有多种最先进的开源和闭源 VLM,探索不同的提示策略;以及基于特定任务 QA 对的 微调 方法,研究模型规模和数据规模的影响。作为基准,我们依靠现有的凝视理解数据集,并与最先进的纯视觉模型进行系统比较。总的来说,我们的结果表明当前的 VLM 缺乏精确的注视理解能力。虽然标准训练有助于缩小与视觉模型的差距,但仍需要重大改进。