论文
从凝视到意义:无需训练 AI代理的统一落地和解释
From Gaze to Meaning: A Training-Free AI Agent for Unified Grounding and Explanation
摘要
理解人类注意力是场景解释的基础,但现有方法通常依赖于缺乏可解释性的经过严格训练的模型。先前的方法很难在没有广泛监督的情况下联合推理凝视目标、关注对象和视觉基础。据我们所知,这项工作引入了第一个 无需训练 Gaze Target Agent (GTA),用于跨注视目标预测、注意力定位和对象识别等任务进行注视引导推理。这是通过利用预训练的视觉语言模型、通过视觉引导提示对其进行增强以及对高不确定性样本采用基于记忆的检索策略来实现的,从而无需额外训练即可提高性能。我们使用定量指标和定性结果来评估我们的方法。从数量上讲,我们的方法在 GazeFollow 和 GazeHOI 基准测试中实现了最先进的性能。定性地,我们的代理提供详细的语义预测,即使 真值 标签错误也能预测正确的目标,并且在没有词汇限制的情况下保持灵活性。