论文
DeepGaze3.5-VL:通过自回归标记预测对扫描路径进行建模
DeepGaze3.5-VL: Modeling Scanpaths via Autoregressive Token Prediction
摘要
随着时间的推移了解人类对场景的视觉注意力可应用于界面设计和推断认知状态等领域。视觉扫描路径建模历来依赖于具有手工设计先验的专门架构。虽然这些架构可以对固定序列进行建模,但它们的刚性结构偏差限制了简单的可扩展性和灵活的调节。例如,集成特定于任务的指令或适应不同的观看者身份需要自定义、不相交的架构添加。我们将扫描路径预测纯粹作为离散序列建模任务。通过将坐标映射到文本词汇表中,我们利用了视觉语言模型的预训练表示。这种框架吸收了多种变化因素:简单的提示可以进行全局调节,例如提供观看者身份以捕获个性化偏见,或特定于任务的目标(例如视觉搜索)。该框架还可以集成每个注视属性,例如单个注视持续时间以及空间位置。自回归对齐可以对每个注视点的对数似然进行可扩展、精确的计算,直接相当于常用的信息增益(IG)度量。我们的模型 DeepGaze3.5-VL 在多个数据集上建立了新的最先进水平,在 MIT1003 上实现了 2.18 位 IG,比 DeepGaze III 提高了 46%。即使基线使用相同的高容量视觉编码器,这一优势仍然存在。除了预测性能之外,我们的生成框架还可以作为直接行为干预的强大计算工具,允许进行受控的计算机模拟,而这在实验上很难或不可能在体内进行。我们通过对眼跳前注视的持续时间进行受控干预来证明这种能力,纯粹从数据中恢复已知的动眼现象。