论文
超越语言:以自我为中心的视觉中的手势来奠定指称表达的基础
Beyond Language: Grounding Referring Expressions with Hand Pointing in Egocentric Vision
摘要
传统的视觉基础(VG)主要依靠文本描述来定位对象,这种范式本质上与语言歧义作斗争,并且经常忽略现实世界交互中普遍存在的非语言指示线索。在自然的以自我为中心的交往中,手势与言语相结合形成了最直观的指点机制。为了弥补这一差距,我们引入了 EgoPoint-Ground,这是第一个致力于以自我为中心的指示性视觉基础的大规模多模态数据集。该数据集包含复杂场景中的超过 \textbf{15k} 个交互式样本,提供丰富的多粒度注释,包括手目标边界框对和密集的语义描述。我们为手势指点表达分辨率建立了全面的基准,评估了广泛的主流多模态 大语言模型 (MLLM) 和最先进的 VG 架构。此外,我们提出了 SV-CoT,一种新颖的基线框架,它将基础重新表述为结构化推理过程,通过视觉思维链范式协同手势和语言线索。大量实验表明,SV-CoT 相对于现有方法实现了 $\textbf{11.7\%}$ 绝对改进,有效减轻了语义歧义并提高了智能体理解多模态物理意图的能力。数据集和代码将公开。