论文

使用感知增强视觉语言模型进行对象参考引导扫描路径预测

Object Referring-Guided Scanpath Prediction with Perception-Enhanced Vision-Language Models

应用与实践视觉感知与空间理解

摘要

对象引用引导扫描路径预测(ORSP)旨在根据描述对象的语言描述来预测人类在视觉场景中搜索特定目标对象时的注意扫描路径。多模态信息融合是ORSP的一个关键点。因此,我们提出了一种新颖的模型 ScanVLA,首先利用视觉语言模型(VLM)从输入图像和引用表达中提取和融合固有对齐的视觉和语言特征表示。接下来,为了增强 ScanVLA 对细粒度位置信息的感知,我们不仅提出了一种新颖的历史增强扫描路径解码器(HESD),直接将历史注视的位置信息作为输入,以帮助预测当前注视的更合理的位置,而且还采用冻结的分割 LoRA 作为辅助组件,以帮助更精确地定位所引用的对象,这改进了扫描路径预测任务,而不会产生额外的大量计算和时间成本。大量的实验结果表明,ScanVLA 在对象引用下可以显着优于现有的扫描路径预测方法。