论文
重新思考对源模型的需求:由视觉语言模型引导的无源域适应从头开始
Rethinking the Need for Source Models: Source-Free Domain Adaptation from Scratch Guided by a Vision-Language Model
摘要
无源域适应 (SFDA) 在不访问源数据的情况下使源模型适应目标域,解决隐私和传输问题。然而,现有的方法仍然从源预训练模型进行初始化,因此并不是真正的无源方法。最近的工作引入了视觉语言(ViL)模型来指导适应过程,在这些方法中,我们观察到对于相同的目标域,不同的源模型在最终结果中产生的变化最小,这表明源模型本身的影响有限。受此启发,我们提出了仅 ViL 域适应(VODA),这是一种更严格的设置,消除了对源域的所有依赖,仅依赖于随机初始化的模型、ViL 模型和未标记的目标数据。我们分析了 VODA 的自适应动态,并引入两阶段去噪区域 蒸馏 (TS-DRD),这是一个两阶段框架,首先用 ViL 指导预热模型,然后寻找 ViL 和自适应模型中固有的去噪区域,从而为 蒸馏 提供更清晰的监督。在 Office-Home、VisDA 和 DomainNet-126 上的实验表明,在 VODA 下,TS-DRD 实现了与仍使用源模型的现有 SFDA 方法竞争或优越的性能,证明了其有效性和 VODA 设置的潜力。