论文
一个场景,两个深度:探讨单目基础模型中的几何模糊性
One Scene, Two Depths: Probing Geometric Ambiguity in Monocular Foundation Models
摘要
忠实的 3D 世界表示应考虑分层几何结构,其中单个相机光线可能包含多个可见且几何有效的表面。然而,单目深度估计将这种结构减少到每个像素一个标量深度。透明场景使这种模糊性变得可测量:相同的光线可以穿过前景玻璃并观察背景,将受监督的目标转变为注释、数据和训练的约定,而不是场景内在的事实。学习的预测器将此约定公开为其深度层偏好。我们引入了 MultiDepth-3k (MD-3k),这是一种稀疏两层序数基准,用于测量深度层偏好和多层空间关系精度 (ML-SRA)。在 MD-3k 上,领先的深度基础模型在标准 RGB 输入下表现出不同的层偏好,表明相同的分层几何体可以在不同模型中以不同的方式解析。我们进一步发现拉普拉斯视觉提示(LVP),一种 无需训练 谱输入变换,可以显着改变某些冻结模型的报告层。最强的 RGB/LVP 对 DAv2-L 达到 75.5% ML-SRA。这些结果表明,深度基础模型可能表达标准 RGB 推理未表达的互补几何假设。我们邀请社区通过模糊感知的视角重新思考深度监督和评估,其中多个有效的 3D 解释被视为需要测量、保存和表达的几何结构。