论文

超越视觉模糊性:通过详细的长图像描述指导具有挑战性的场景中的鲁棒单目深度估计

Beyond Visual Ambiguity: Guiding Robust Monocular Depth Estimation in Challenging Scenarios via Detailed Long Captions

应用与实践视觉感知与空间理解

摘要

由于单图像有限信息固有的视觉模糊性,单目深度估计(MDE)面临非朗伯表面和恶劣天气条件的挑战。现有的作品通过图像修复或增强来单独解决这些问题,但鲁棒性收益有限。语言作为视觉的强大补充方式,被证明可以通过详细的长图像描述增强视觉语言模型(VLM)的视觉感知能力。然而,由于信息有限的短文本输入、粗略的全局文本特征学习以及深度解码过程中有限的语言指导,先前的语言集成 MDE 方法未能充分利用这种潜力。为了解决这些限制,我们提出了 CapDepth,这是一种用于稳健 MDE 的新颖框架,它利用详细的长图像描述的指导来减轻这两种具有挑战性的场景中的视觉模糊性。首先,我们设计了一个详细的长图像描述输入模板,它明确地传达了多个原子句子之间丰富的空间关系。其次,引入动态描述编码器,通过渐进式屏蔽注意力提取细粒度的深度相关文本特征。最后,我们提出了一种文本自适应解码器,它通过稳定的自适应层归一化来指导使用文本特征进行增强深度解码。大量实验验证了 CapDepth 的功效,其性能优于最先进的方法,在非朗伯表面上实现了 25.0% 的深度误差减少,在恶劣天气条件下实现了 22.0% 的深度误差减少。