论文

GIFT:用于非朗伯单眼深度估计的几何不变 微调

GIFT: Geometry-Invariant Fine-Tuning for Non-Lambertian Monocular Depth Estimation

模型训练参数高效训练

摘要

单目深度基础模型受益于大规模合成训练数据,表现出很强的泛化能力。然而,他们经常产生非朗伯表面的深度幻觉,估计镜子中的反射内容或玻璃后面的透射内容,而不是物理表面本身。将这些模型与现实世界的数据相适应具有挑战性,因为传统的深度传感器在这些区域也不可靠。我们观察到,虽然非朗伯表面的外观随其反射或透射环境而变化,但其基础几何形状保持不变。基于这一观察,我们提出了 GIFT(几何不变 微调),这是一种参数高效的 后训练 框架,不需要测量深度标签。我们在受控的外观变化下收集 RGB 图像组,同时保持相机和目标几何形状固定。 GIFT 利用这些观察结果的几何不变性来抑制非朗伯深度幻觉,同时保留一般深度估计能力。我们进一步构建了一个受控基准,用于评估非朗伯深度恢复、对外观变化的鲁棒性以及其他区域的性能保留。在我们的基准和独立的真实世界数据集上进行的实验表明,GIFT 改进了镜子和透明物体的深度预测,同时在很大程度上保留了基础模型的性能,为使单目深度基础模型适应非朗伯场景提供了一种实用且低成本的方法。