论文

OpenVAM:把显著性定位与视觉语言解释对齐

OpenVAM: Open-World Visual Attention Modeling with VLMs

应用与实践视觉感知与空间理解

摘要

预测人类视线是从 Web/UI 设计分析到机器人和人机交互等应用的核心功能。然而,大多数视觉注意力建模方法仅输出密集的显着性图,这通常不足以采取行动:从业者需要将注意力峰值与场景中的离散元素(什么)联系起来,并了解上下文中这些峰值的驱动因素(为什么),同时对跨自然图像、商业内容和 UI/Web 布局的领域转移保持鲁棒性。因此,我们引入了 OpenVAM(使用 VLM 的开放世界视觉注意力建模),这是一个统一的框架,可共同解决异构领域(自然场景、商业图像和 UI/Web 布局)和监督模式的通用性和可解释性。 OpenVAM 采用解耦但对齐的设计:专用的密集视觉路径提供稳定、空间精确的定位,而遵循指令的视觉语言语义头则根据相同的图像和数据类型提示生成基于“什么/为什么”的解释。三阶段训练策略保留了强大的本地化先验,同时逐步引入语言基础并通过参数有效的适应改进解释对齐,而不干扰显着性分支。我们进一步提出了一个可扩展的管道来生成用于训练和系统评估的多域显着性原因注释。跨不同数据集的实验表明,OpenVAM 提高了域转移下的鲁棒性,同时生成基于图像的解释,使显着性预测更容易解释。

OpenVAM数据集的领域和场景组成。
图2(图注摘要):OpenVAM数据集的领域和场景组成。