论文
通过 微调 和强化学习迈向稳健的无监督域适应
A Step Towards Robust Unsupervised Domain Adaptation via Fine-Tuning and Reinforcement Learning
摘要
由于噪声伪标签以及干净源域和受到对抗性扰动的目标域之间固有的分布变化,无监督域适应(UDA)中的对抗鲁棒性仍然是一个重大挑战。现有方法通常无法在鲁棒性和准确性之间实现最佳权衡,因为领域适应模型生成的伪标签往往会在对抗性攻击下引入分类错误。在这项工作中,我们提出了 \textbf{SFT+RL},这是一个两阶段的鲁棒 UDA 框架,它在 CLIP 的预训练视觉编码器之上集成了监督 微调 (SFT) 和强化学习 (RL)。在 SFT 阶段,我们在标记源域上使用基于 PGD 的扰动来对抗性地微调线性分类器,同时部分解冻 CLIP 的投影层。它允许适应对抗性噪声,同时保留 CLIP 丰富的语义先验。我们在强化学习阶段引入了置信引导的伪标记策略来逐步注释未标记的目标样本。使用衰减置信阈值过滤伪标签以平衡质量和覆盖范围,并在通过将干净的源样本与高置信度目标样本相结合而形成的复合数据集上训练模型。对抗性训练应用于混合批次的干净示例和对抗性示例,以增强跨域鲁棒性。对三个基准数据集 OfficeHome~\cite{tomm-ude}、PACS~\cite{pacs} 和 VisDA~\cite{visda} 的综合评估证明了我们方法的有效性。值得注意的是,在所有三个数据集上,\textbf{SFT+RL} 在干净精度方面实现了 \textbf{10.2\%} 的平均改进,在对抗鲁棒性方面实现了 \textbf{15.8\%} 的平均改进,优于现有的最先进方法。