论文

DrivingDepth:用于驾驶深度估计的稀疏提示逐像素尺度校正

DrivingDepth: Sparse-Prompted Pixel-wise Scale Correction for Driving Depth Estimation

应用与实践视觉感知与空间理解

摘要

自动驾驶的密集深度估计面临着几何尺度冲突:深度基础模型提供像素对齐的密集视觉几何,但没有可靠的度量尺度,而投影激光雷达提供的度量锚点稀疏、有噪声且与图像结构不对齐。现有的稀疏提示方法通过从头开始重新生成深度、覆盖基础模型的相干几何形状并在视觉上连续的表面上产生结构伪影来整合激光雷达。我们的主要见解是基础模型已经捕获了几何相干的相对深度;不需要额外的表面结构学习,只需将相对几何形状映射到公制坐标的每像素比例因子。基于此,我们提出了 DrivingDepth,它将稀疏 LiDAR 视为几何提示,通过残余像素级尺度校正事先对冻结的基础进行本地校准,通过构造保留密集的视觉几何。在具有 4 帧环视输入的 nuScenes 上,DrivingDepth 的 AbsRel 为 11.19,EdgeCR 为 5.741,通过同时提供 SOTA 度量精度和几何一致性,优于 MapAnything (11.99/1.914)。