论文
Ground3D-LMM:使用 LMM 进行细粒度 3D 点定位和空间推理
Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM
摘要
当响应可验证且具有指标性时,有关 3D 环境的自然语言查询就变得可行。可验证性需要明确地基于所涉及的 3D 区域,而公制答案则以现实世界单位报告物理测量结果(例如尺寸、厚度、间隙和距离)。现有的 3D 大型多模态模型 (LMM) 方法仍然有限:对话系统通常在没有明确的 3D定位依据的情况下做出响应,而 3D 基础模型并不是为交互式、度量感知的对话而设计的。在本文中,我们提出了 Ground3D-LMM,这是一个统一模型,它采用点云和可选的 RGB 图像作为输入,并支持 3D 空间对话,其中 (i) 点定位响应和 (ii) 对象和部分粒度的度量数值输出,包括多对象查询。为了评估定位和测量的交集,我们定义了 3D定位测量任务,该任务需要预测所涉及的 3D 区域和现实世界单位中的相应度量数量。我们引入了一个基于 ScanNet 和 ScanNet++ 数据集构建的大型数据集,其中包含密集的对象和零件注释以及跨越 8 个任务的大约 250 万个问答对,以及手动验证的测试集。对多个数据集和任务的广泛实验表明,我们提出的 Ground3D-LMM 模型为有根据的、度量感知的 3D 对话理解提供了强大的基线。我们的数据集和模型是公开的。