论文
具有视觉语言先验的无源域适应
Source-Free Domain Adaptation with Vision-Language Prior
摘要
无源域适应 (SFDA) 旨在将在受监督源域上预先训练的源模型调整为目标域,并且只能访问未标记的目标训练数据。依靠伪标签和/或辅助监督,传统方法不可避免地容易出错。为了缓解这一限制,在这项工作中,我们首次探索了具有丰富而异构知识的现成视觉语言(ViL)多模态模型(例如 CLIP)的潜力。我们发现,以零样本方式直接将 ViL 模型应用到目标域并不令人满意,因为它并不是专门用于此特定任务,而是在很大程度上是通用的。为了使其针对特定任务,我们提出了一种新颖的 DIFO++ 方法。具体来说,DIFO++在适应期间在两个步骤之间交替:(i)通过以快速学习的方式最大化与目标模型的互信息来定制ViL模型,(ii)将这个定制的ViL模型的知识提炼到目标模型,以间隙区域减少为中心。在渐进式知识适应过程中,我们首先识别并关注间隙区域,其中封闭的特征相互纠缠且类别模糊,因为它通常捕获更丰富的特定于任务的语义。然后,在记忆机制的支持下,通过融合目标模型和 ViL 模型的预测来生成可靠的伪标签。最后,间隙区域减少由类别注意力和语义对齐的预测一致性指导,并辅以参考熵最小化以抑制不确定性。大量实验表明 DIFO++ 的性能明显优于最先进的替代方案。我们的代码和数据可在 https://github.com/tntek/DIFO-Plus 上获取。