论文
SaaF:面向交互式现实世界对象检索的场景特定模糊性感知 3D 语言场
SaaF: Scene-Specific Ambiguity-Aware 3D Language Fields towards Interactive Real-World Object Retrieval
摘要
我们提出了场景特定的歧义感知 3D 语言场 (SaaF),这是一种新颖的基于高斯分布的 3D 语言场,设计用于给定现实世界场景中的交互式对象检索。使用自然语言进行交互式对象检索是在复杂的现实环境中运行的服务机器人的一项关键功能。虽然最近用于对象检索的 3D 语言字段方法在渲染像素和自动编码器压缩的 CLIP 特征之间建立了关联,但它们受到两个限制:(1) 由于特征压缩而降低了相似对象之间的可辨别性,以及 (2) 对模糊查询的处理不佳,通常会导致检索不稳定或不正确。为了解决这些限制,SaaF 引入了一种度量学习策略来构建一个统一的特征空间,该特征空间既具有实例区分性又具有模糊性感知能力。 (i) 为了增强实例级视觉辨别力,SaaF 采用度量学习,将同一对象的多个视点的图像特征拉近到特征空间中。 (ii)为了建立歧义意识,该模型联合训练由所提出的方法从每个跟踪对象图像序列生成的多个文本标签(包括歧义描述),以学习目标场景中歧义特征和特定特征之间的语义关系。该特征空间可以实现细粒度的视觉理解,同时允许系统估计查询模糊性并在需要时交互式地请求澄清。实验结果表明,SaaF 不仅比以前的方法提高了检索准确性,而且还可以在开放词汇设置下稳健地检测和处理用户文本查询中的歧义性。