论文
从场景到物体:文本引导的双注视预测
From Scene to Object: Text-Guided Dual-Gaze Prediction
摘要
可解释的驾驶员注意力预测对于类人自动驾驶至关重要。然而,现有数据集仅提供场景级全局注视,而不提供细粒度的对象级注释,本质上无法支持基于文本的认知建模。因此,虽然视觉语言模型(VLM)在语义推理方面具有巨大潜力,但这种关键的数据限制会导致严重的文本视觉解耦和视觉偏见幻觉。为了突破这一瓶颈,实现精确的物体级注意力预测,本文提出了一种新颖的双分支注视预测框架,建立了从数据构建到模型架构的完整范式。首先,我们构建 G-W3DA,一个对象级驾驶员注意力数据集。通过将多模态 大语言模型 与 Segment Anything Model 3 (SAM3) 集成,我们在严格的交叉验证下将宏观热图解耦为对象级掩模,从根本上消除了注释幻觉。在此高质量数据基础上,我们提出了 DualGaze-VLM 架构。该架构提取语义查询的隐藏状态,并通过条件感知 SE-Gate 动态调整视觉特征,实现意图驱动的精确空间锚定。 W3DA 基准的大量实验表明,DualGaze-VLM 在空间对齐指标方面始终超越现有的最先进 (SOTA) 模型,特别是在安全关键场景下,相似度 (SIM) 提高了 17.8%。此外,视觉图灵测试表明,88.22% 的人类评估者认为 DualGaze-VLM 生成的注意力热图是真实的,证明了其生成理性认知先验的能力。