论文
DepthART:将单目深度基础模型能力迁移到微型模型
DepthART: Scaling Foundation Monocular Depth to Tiny Models
摘要
最近的几何基础模型(例如 Metric3D、Depth Anything 和 UniDepth)在跨场景泛化和度量尺度预测方面显着改进了单目深度估计 (MDE),但这些成果尚未转化为微小模型。我们通过 DepthART(Depth Anything Rethought for Tiny Models)弥补了这一差距,它是一个紧凑的 MDE 模型,用于跨不同场景的设备上部署。我们首先确定了微小模型中的两个容量驱动的瓶颈:(i)过度拟合数据集特定的分布偏差和(ii)相机移位下不稳定的度量适应,其中完整的 微调 很容易损坏可转移的几何形状。因此,DepthART 结合了两种简单但有效的策略:抗偏差数据采样方案,用于在相同的训练预算下减少分布偏差,以及相机调节的 微调 协议,该协议冻结蒸馏编码器并根据相机内参调整度量尺度,同时更好地保留跨数据集泛化。在整个数据集中,DepthART 在零样本泛化和度量精度方面始终超越了之前的微小基线(例如,NYUD v2 上的 DepthART-S 的零样本 $δ_1$=0.964),并且在某些情况下接近重型模型。我们还提供了一个可扩展的模型系列,DepthART-S 在 RTX A6000 上达到 347/245 FPS(严格的 FP32),输入分辨率分别为224²/448²,在 Orin NX 8GB 上达到 102 FPS (TF32),在 Jetson Nano 4GB 上超过 15 FPS (FP32)。