论文

OmniGF:用于统一注视跟踪的双分支视觉语言框架

OmniGF: A Dual-Branch Vision-Language Framework for Unified Gaze Following

应用与实践视觉感知与空间理解

摘要

理解人类注视行为对于复杂场景理解和人机交互至关重要。传统的注视跟随模型通常仅限于纯粹的空间定位,缺乏推理语义目标或复杂社会背景的高级能力。此外,这些模型通常按顺序处理个体,需要对同一场景图像进行冗余计算以进行多人推理。虽然最近的视觉语言模型(VLM)提供了解决与注视相关的语义任务所需的特殊语义推理,但它们对离散文本生成的依赖本质上限制了注视定位等连续空间任务的精度。为了弥补这一差距,我们提出了 OmniGF,这是一个统一的视觉语言框架,它采用基础 VLM 来实现高度可扩展的多人凝视推理。该模型采用双分支解码策略:结构化语言分支生成离散推理状态,而连续空间分支直接利用 VLM 的密集隐藏状态。使用高分辨率注视目标热图来监督这些提取的表示,有效地克服了纯文本坐标生成的空间瓶颈。此外,为了在多人场景中明确地建立模型,我们使用从裁剪的头部图像编码的头部嵌入来增强输入,同时为所有个体提供细粒度的外观和方向线索。通过对所有个体进行建模并利用 VLM 强大的语义功能,OmniGF 无缝集成了精确的空间注视目标估计、语义注视预测和复杂的社交注视推理。大量的实验表明,我们的框架在多个标准基准测试中建立了新的最先进的性能。代码可在 https://github.com/cvlab-stonybrook/omnigf 获取。