论文

稀疏观测的大深度完井模型

Large Depth Completion Model from Sparse Observations

应用与实践视觉感知与空间理解

摘要

这项工作提出了大深度完成模型(LDCM),这是一个简单、有效且稳健的框架,用于稀疏观测的单视图度量深度估计。 LDCM 无需依赖复杂的架构设计,即可使用 Transformer 生成度量精确的密集深度图。它在不同的数据集和稀疏的观察中优于现有的方法。我们从两个关键角度实现这一目标:(1)利用现有的单目基础模型来提高稀疏深度输入的质量,以及(2)重新制定训练目标以更好地捕获几何结构和度量一致性。具体来说,首先引入基于泊松的深度初始化策略,从不同的稀疏观测中生成均匀的粗密深度图,为网络提供强大的结构先验。关于训练目标,我们用点图头替换了传统的深度头,该点图头可回归相机空间中的每像素 3D 坐标,使模型能够直接学习底层 3D 场景结构,而不是执行逐像素深度图恢复。此外,这种设计消除了对相机内部参数的需求,使 LDCM 能够自然地生成公制尺度的 3D 点图。大量实验表明,LDCM 在深度补全和点图估计方面在多个基准和不同稀疏度水平上始终优于最先进的方法,展示了其有效性和对未见数据分布的强大泛化能力。