论文

从透视到鱼眼深度估计和开放词汇分割

From Perspective to Fisheye Depth Estimation and Open-Vocabulary Segmentation

应用与实践视觉感知与空间理解

摘要

视觉基础模型能够通过高保真度估计泛化 3 维 (3D) 场景;他们的经验成功可以归因于对大规模透视图像数据集的训练。然而,当传输到宽视场 (FoV) 图像(例如鱼眼相机捕获的图像)时,由于图像像素的径向畸变引起的协变量偏移,它们会返回错误的输出。我们提出了一种将视觉基础模型推广到鱼眼相机的方法。我们方法的关键在于一组可学习的参数,称为失真扩展器(DEX),它们对鱼眼失真系数以及潜在空间中编码的鱼眼和透视图像之间的分布变化进行建模。通过最小化自监督对齐损失,DEX 将鱼眼图像的潜在嵌入转换为类似于透视图像的潜在嵌入,以恢复高保真度估计。 DEX 与架构和任务无关:我们在基于卷积和 Transformer 的架构的单目深度估计和开放词汇分割上演示了 DEX,我们在室内和室外鱼眼数据集的基线上持续改进。作为副产品,DEX 的激活也可以解码为失真系数以支持相机校准。代码位于:https://github.com/Suchisrit/DEX。