论文

Marigold V2:重新审视用于单目深度估计的扩散 Transformer

Marigold V2: Revisiting Diffusion Transformers for Monocular Depth Estimation

模型训练监督微调与指令调优

摘要

单目深度估计是一项普遍存在但高度不适定的计算机视觉任务,其下游应用领域包括场景重建、计算摄影和机器人技术等。尽管该领域已经成熟,但最近的模型仍然难以推广到分布外的输入并生成清晰且详细的深度图。在本文中,我们重新审视 Marigold,这是一套将现代图像生成和编辑模型重新利用的技术,由扩散 Transformer (DiT) 架构提供支持,将其转变为最先进的单目深度估计器。我们的方案的目标是从预训练的多步流匹配模型中进行单步推理,并在需要时进行量化,保留模型容量,同时保持运行成本低廉。我们分析了朴素训练的工件,并确定了两种有效的补救措施:将模型的内部表示与从 真值 中提取的语义特征对齐,并采用围绕新颖的基于 Sinkhorn 的损失构建的 2 阶段 微调 协议。结果是更清晰、更干净的深度图,可以很好地概括出分布外的情况,与之前 KITTI 和 ETH3D 上的最佳结果相比,AbsRel 提高了 16-26%。定性地讲,我们的模型解决了先前模型无法解决的毛皮、树叶和细如发丝的边缘问题。此外,Marigold V2 在应用于其他密集回归任务(例如表面法线估计和内在图像分解)时实现了最先进的结果。项目网站:https://hf.co/spaces/huawei-bayerlab/marigold-v2-web