论文
扩展 3D 视觉定位的多样化语言生成
Scaling Diverse Language Generation for 3D Visual Grounding
摘要
开发强大的 3D 视觉定位 (3DVG) 模型(以自然语言描述的 3D 场景中的实体定位)对于使代理能够将空间语言与物理世界中的对象相对应非常重要。然而,缺乏大规模的多样化描述导致模型无法推广到简单的语言模式之外。最近的此类尝试缺乏用于地面物体的约束类型和语言的多样性。字幕方法无法精确对比对象,这对于视觉定位很重要。因此,我们提出了 ViGiL3D++,这是一种可扩展的、与场景无关的方法,通过将场景图中的约束采样与 LLM 的语言生成相结合来生成各种视觉定位查询。我们表明,它比现有的缩放数据集具有更大的多样性,并且比多个 3DVG 基准提高了模型性能,但也阐明了 VLM 的突出局限性。