论文

GuideGround:VLM 引导的语义理解和视点感知推理,用于 3D 视觉基础

GuideGround: VLM-guided Semantic Understanding and Viewpoint-aware Reasoning for 3D Visual Grounding

模型推理推理验证与自校正

摘要

3D 视觉基础旨在通过自然语言查询定位 3D 场景中的目标对象,需要细粒度的语义理解和视点相关的空间推理。现有方法通常将语义理解作为辅助的闭集对象分类任务,并依赖多视图特征聚合进行观点推理,限制了语义泛化并削弱了观点特定的证据。我们观察到视觉语言模型通过开放词汇语义理解和全局场景感知自然地提供互补功能。基于这一见解,我们提出了 GuideGround,这是一个 VLM 引导的框架,它通过利用 VLM 进行语义增强和特定观点的假设验证来补充而不是取代特定任务的基础模型。具体来说,我们用 VLM 生成的对象语义描述替换辅助闭集对象分类,以增强语义理解。同时,我们不是直接聚合多视图表示,而是通过每个视图的基础保留特定于视点的基础假设,并使用跨候选视点的 VLM 显式验证它们。 ReferIt3D 基准测试的大量实验表明,GuideGround 的性能始终优于以前最先进的方法。综合消融研究进一步证实了所提出的语义理解和观点推理策略的有效性。