论文

TDVR:零样本 3D 视觉基础的联合文本消歧和视角推理

TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding

模型推理推理策略与问题分解

摘要

零样本 3D 视觉基础旨在根据文本描述和 3D 视觉输入来定位特定对象。然而,模糊的查询文本和不足的观点严重阻碍了现有方法的有效性。为了解决这些问题,我们提出了 TDVR,这是一种 无需训练 推理框架,可以消除输入文本的歧义并推断零镜头 3D 视觉基础的准确视点。首先,我们从 3D 点云中检测到的实例构建语义 3D 场景图。随后,我们将原始查询、外观和空间关系描述放入LLM中进行融合,从而消除初始输入的歧义。我们利用思想链推理来生成消除歧义查询的结构化表示。然后以场景图和结构化查询为输入,通过视点推理得到最佳视图,解决视觉定位过程中视点丢失的问题。基于获得的最佳视点,我们进一步区分干扰对象,使模型具有区分相似实例的能力。之后,我们通过计算特征向量的相似度将类别文本和外观图像与查询进行匹配。最后,通过综合视点得分、混淆得分、类别得分和外观得分来识别目标对象。与之前的方法相比,我们的TDVR在视点推理、相似对象辨别和模糊查询理解方面具有更强的能力。在公共 ScanRefer 数据集上的实验结果表明,我们的方法在 Acc@0.25 和 Acc@0.5 上分别优于现有最先进的方法 15.25% 和 14.46%,证明了我们的 TDVR 在解决模糊查询文本和缺陷观点方面的有效性。