论文
开放词汇注视目标预测:基准和方法
Open-Vocabulary Gaze Object Prediction: Benchmark and Method
摘要
凝视对象预测(GOP)旨在定位和识别人类关注的对象,这是理解以人为中心的交互的关键任务。然而,现有的方法通常是在具有固定标签空间的封闭词汇范式下进行训练,并在特定于场景的数据集上进行评估,这限制了它们在现实场景中的适用性,在现实场景中,注视目标通常遵循长尾分布或属于看不见的类别。为了解决这一差距,我们引入了用于注视对象预测的多样化场景 (DiSG),这是一个包含 86 个野外类别的基准,有助于评估开放词汇 GOP (OVGOP)。在 DiSG 的基础上,我们提出了一个框架,利用文本驱动的对象发现来定位潜在的注视候选对象,并使用注视引导选择模块从候选对象中精确定位预期目标。此外,为了更好地捕获各种野外类别的语义知识,我们引入了梯度知情选择调整(GIST)来有选择地更新与给定类别词汇表最相关的参数。大量的实验表明,我们提出的模型在开放词汇设置中表现有效,并且在传统的封闭词汇设置中也优于现有方法。基准测试和代码可在 https://github.com/sensniu/ovgop 获取。