论文

PruneGround:用于 3D视觉定位的即插即用空间修剪

PruneGround: Plug-and-play Spatial Pruning for 3D Visual Grounding

应用与实践视觉感知与空间理解

摘要

3D视觉定位 (3DVG) 旨在根据自然语言描述来定位 3D 场景中的目标对象。现有的方法通常对整个场景进行推理,从而导致模糊的预测和高昂的计算成本,尤其是在混乱的环境中。我们观察到许多指称表达依赖于局部空间上下文,并且通常对应于受限的空间区域而不是整个场景。受这一见解的启发,我们提出了 PruneGround,这是一个基于三个关键组件构建的有效的即插即用 3DVG 框架。首先,我们引入语言引导空间修剪(LGSP),它利用冻结的视觉语言模型(VLM)来识别与语言相关的区域,从而减少空间计算并将候选者置于更窄的搜索空间中。其次,我们提出多视图条件描述重构(MCDR),它将复杂的表达式分解为简化的目标锚关系,并通过多视图推理来增强缺失的空间线索。最后,我们提出了 LLM-Grounder,它通过在修剪区域内对齐点云和语言表示,将检测预训练的空间 LLM 重新调整为语言条件的定位模型。对三个最流行的点云基准进行的大量实验表明,我们的方法在所有三个 ScanRefer 设置以及 10 个 Nr3D/Sr3D 设置中的 9 个设置上实现了最先进的结果。代码和模型已公开:https://github.com/leduckhai/PruneGround