论文

无监督域适应的双基础模型

Dual-Foundation Models for Unsupervised Domain Adaptation

应用与实践视觉感知与空间理解

摘要

语义分割提供了对于自动驾驶和细粒度感知任务至关重要的像素级场景理解。然而,训练分割模型需要对现实数据集进行成本高昂、劳动密集型的注释。无监督域适应(UDA)通过在标记的合成数据上训练模型并使它们适应未标记的真实图像来解决这个问题。虽然概念上很简单,但由于域差距(即合成数据与真实数据之间视觉外观和场景结构的差异),适应具有挑战性。先前的方法通过像素级混合或特征级对比学习来弥补这一差距。然而,这些技术存在两个主要局限性:(1)对高置信度伪标签的依赖将学习限制在目标域的子集,(2)基于原型的对比方法从源训练模型初始化类原型,在适应过程中产生有偏差和不稳定的锚点。为了解决这些问题,我们提出了一个双基础 UDA 框架,该框架利用两个互补的基础模型。首先,我们采用具有超像素引导提示的分段任意模型(SAM),以便能够从高置信度预测之外的更广泛的目标像素中进行学习。其次,我们结合 DINOv3 通过其强大的表示学习构建稳定的、领域不变的类原型。我们的方法在 GTA-to-Cityscapes 和 SYNTHIA-to-Cityscapes 上比强大的 UDA 基线分别实现了 +1.3% 和 +1.4% mIoU 的持续改进。