论文

EagleDepth:通过像素扩散解码器进行高效的细粒度深度估计

EagleDepth: Efficient Fine-Grained Depth Estimation via Pixel Diffusion Decoder

应用与实践视觉感知与空间理解

摘要

从高分辨率图像中恢复详细的几何形状对于精确感知周围环境和物体至关重要。然而,使用潜在空间建模和 VAE 重建的现有方法可能会损害几何细节。此外,从潜在代码进行解码会带来大量的推理开销。为了解决这些问题,我们提出了 EagleDepth,这是一种用于高分辨率单目深度估计的有效框架,它将潜在扩散的几何先验与细粒度像素空间生成相结合。我们的关键思想是保留深度感知的潜在表示作为指导,同时直接在像素空间中生成最终的深度图。我们按顺序训练潜在组件和像素组件:首先,我们使用成对的 RGB 深度监督微调预训练潜在扩散模型;然后,我们采用预训练的像素扩散解码器 PiD 来预测基于学习特征的深度。像素组件的训练从 1024 分辨率开始,一直持续到高达 4K 的多个分辨率。潜在分支处理调整大小的低分辨率 RGB 图像,而像素分支则绕过原始 VAE 解码器以目标分辨率生成深度。该设计保留了学到的几何知识,而不需要潜在的骨干模型在输出分辨率下运行。在五个常用的深度估计数据集和高分辨率 Synth4K 数据集上,我们的框架实现了最先进的深度估计性能,具有更快的推理速度以及更好地保留精细结构和对象边界。

EagleDepth:通过像素扩散解码器进行高效的细粒度深度估计的原论文方法或结果图
图 1:EagleDepth 擅长从高分辨率图像预测细粒度深度图。与最先进的方法相比,我们的模型以更快的推理速度实现了更好的深度估计结果,如雷达图所示(五个 Synth4K(Yu 等人,2026a)子集的质量指标平均值;半径越大表示性能越好)