论文

使用视点相关的空间关系进行 3D 分割

3D Segmentation Using Viewpoint-Dependent Spatial Relationships

模型评测基准与评测资源

摘要

3D 数据集和多模态模型的最新进展极大地提高了自然语言 3D 场景理解。然而,大多数3D参考分割方法并没有明确地表示观察者的视点,使得诸如“左”、“右”、“前”和“后”等空间关系不明确且难以评估。我们引入了一个包含 22 万个基准样本的视点感知 3D 参考分割数据集,并通过密集视点采样可扩展到数千万个视点条件样本。在此数据集中,目标对象只能通过以观察者为中心的空间关系来识别,因此需要视点条件空间定位。我们通过利用相机姿势自动注释以观察者为中心的关系(左/右、前/后)以及与视点无关的关系(上/下)来构建基准。使用此基准,我们在零样本设置中评估了几个现有的 3D 大型多模态模型,发现当前模型难以处理依赖于视点的空间指令。我们进一步研究如何将明确的视点信息纳入 3D 大型多模态模型中。我们引入了一种视点表示,它对相机姿势进行编码,并在观察视点上调节模型,从而提高视点相关关系的分割精度,并将 mIoU 从 0.30 增加到 0.47(与没有视点调节的模型相比)。数据集、代码和训练模型将在接受后公开发布。