论文

检索到本地化:连接大型语言模型和 LiDAR 几何以实现空间基础

Retrieve-to-Localize: Bridging Large Language Models and LiDAR Geometry for Spatial Grounding

应用与实践视觉感知与空间理解

摘要

激光雷达为空间感知任务(例如自动驾驶和户外机器人中的物体检测)提供精确的几何信息。然而,识别和定位单个物体并不足以回答需要构建空间关系和确定预期目标的问题。受自动驾驶大型语言模型 (LLM) 最新进展的推动,我们利用其语言先验来解释复杂的空间问题,并将参考目标置于 LiDAR 几何中。为了支持这种空间基础能力,我们引入了 SpatialLiDAR-QA,它将单步和多步关系基础与互补的空间理解任务结合起来。我们进一步提出 SpatialLiDAR-LM,它将 LiDAR 点特征与 LLM 对齐,并通过语言条件、位置感知提案检索和局部点细化来确定地面目标坐标。该设计直接从本地 LiDAR 几何形状而不是通过文本语言解码得出目标坐标。实验表明,在精确坐标预测任务上,与代表性 LiDAR 语言模型和多摄像头 VLM 相比,有了显着改进。我们的数据集和模型训练代码将公开发布。