论文
增强视线追踪视觉基础模型中的视线推理
Enhancing Gaze Reasoning in Vision Foundation Models for Gaze Following
摘要
注视跟踪需要场景理解和注视推理来定位场景中人的注视目标。最近,视觉基础模型(VFM)在这项任务上表现出了强大的性能,实现了更简单的架构,同时超越了先前的方法。然而,我们观察到基于 VFM 的方法的一个关键局限性:虽然 VFM 极大地改善了场景理解,但它们对注视推理的贡献甚微。因此,现有的方法通常依赖于语义上显着的对象而不是真实的注视线索,从而导致当目标不显着时性能下降。为了解决这个问题,我们提出了一种新的训练机制来增强 VFM 中的注视推理以进行注视跟踪。我们的方法包括:(1) 头部调节的局部 LoRA,它能够实现局部适应以保留场景标记学习,同时改进用于注视推理的头部标记学习; (2) 锥外惩罚,将注视线索注入头部标记,同时将它们与场景标记对齐。 GazeFollow 和 VAT 数据集上的实验表明,我们的方法实现了最先进的性能,当注视目标在语义上不显着时,改进尤其显着。我们的研究结果为推进未来的凝视跟踪研究提供了宝贵的见解。论文被接受后,我们将发布代码。