论文
通过自监督 ViT 特征和单目基础模型实现高度完成的测试时间适应
Test-Time Adaptation for Height Completion via Self-Supervised ViT Features and Monocular Foundation Models
摘要
准确的数字表面模型 (DSM) 对于许多地理空间应用至关重要,包括城市监测、环境分析、基础设施管理和变化检测。然而,由于采集限制、重建工件或建筑环境的变化,大规模 DSM 经常包含不完整或过时的区域。传统的高度补全方法主要依赖于空间插值或假设空间连续性,因此当对象丢失时会失败。最近基于学习的方法提高了重建质量,但通常需要对特定传感器数据集进行监督训练,限制了它们跨领域和传感条件的泛化。我们提出了 Prior2DSM,这是一个用于度量 DSM 完成的 无需训练 框架,它通过利用基础模型完全在测试时运行。与之前需要特定任务训练的高度完成方法不同,所提出的方法将 DINOv3 的自监督 Vision Transformer (ViT) 特征与单目深度基础模型相结合,通过语义特征空间对应从不完整的高度先验传播度量信息。测试时自适应 (TTA) 是使用参数高效的低秩自适应 (LoRA) 和轻量级多层感知器 (MLP) 来执行的,MLP 可预测空间变化的尺度和移位参数,以将相对深度估计转换为公制高度。实验证明了相对于基于插值的方法、基于先验的缩放高度方法和最先进的单目深度估计模型的一致改进。 Prior2DSM 减少了重建误差,同时保留了结构保真度,与 MDE 的线性拟合相比,RMSE 降低了 46%,并进一步实现了 DSM 更新和耦合 RGB-DSM 生成。