论文

单目几何基础的稀疏激光雷达提示:长距离驾驶深度的实证研究

Sparse-LiDAR Prompting of Monocular Geometry Foundations: An Empirical Study Toward Long-Range Driving Depth

应用与实践视觉感知与空间理解

摘要

稀疏 LiDAR 提示的深度基础模型(PromptDA、Prior Depth Anything、DMD3C)在室内场景或 KITTI 标准 80 米评估上限内显示出强大的结果。然而,仍然存在两个局限性:(i) 基本上缺乏长距离驾驶模式(50-150 m)的系统距离分层评估; (ii) 基于视差基础的现有方法依赖于预插值密集先验,而在点图基础(例如 MoGe-2、NeurIPS 2025)上真正稀疏的 LiDAR 注入尚未探索。我们提出了 SLIM(稀疏激光雷达注入单目几何结构),这是 MoGe-2 的第一个改编,可以接受真正稀疏的激光雷达输入​​。 SLIM 将部分卷积稀疏编码器与多尺度融合颈集成在一起,将 LiDAR 特征融合到五个尺度的点图解码器中。我们采用与密度无关的训练(随机注入比率在 [0.005, 0.30] 范围内),因此单个模型可以服务于不同的输入密度。在 Virtual KITTI 和 CARLA 上,SLIM 在 100-150 m 处将 MoGe-2 基线的绝对相对误差降低了约 39-51%。六种注入比率的消融表明,部分卷积注入在所有六种设置中都改善了 Virtual KITTI 上的 AbsRel 和 RMSE;在 CARLA 上,AbsRel 在 6 种设置中的 5 种中得到了改进(一种在 0.015 处接近平局,相差 0.0013),并且 RMSE 在各个编码器中具有可比性,其中部分卷积在三种设置中得到改进(最多 0.31 个单位),而在其他三种设置中最多损失 0.11 个单位。