论文
VT-DUDA:用于扩散引导的无监督域适应的视觉词元调节
VT-DUDA: Visual Token Conditioning for Diffusion-guided Unsupervised Domain Adaptation
摘要
无监督域适应(UDA)旨在从分布转移下的标记源数据和未标记目标数据中学习目标域分类器。最近基于扩散的 UDA 方法通过合成标记的目标样式图像并对生成的合成数据进行训练来解决此问题。然而,它们的性能在很大程度上取决于调节设计:类提示仅提供粗略指导,而领域适应模块主要控制外观,这可能导致目标样式合成不充分指定。我们提出了 VT-DUDA,一种用于扩散引导 UDA 的视觉标记调节框架。 VT-DUDA 不只依赖文本提示,而是使用源图像为目标样式合成提供额外的实例级视觉上下文。具体来说,VT-DUDA 将每个源图像映射到视觉标记的紧凑序列,并通过沿着潜在扩散模型的交叉注意上下文维度将这些标记与相应的文本嵌入连接起来形成混合条件上下文。这提供了超越文本的依赖于实例的调节,同时使用目标域适配器分支执行合成。由于指导明确表示为词元序列,因此同一接口还允许通过词元选择和词元强度调整对调节信号进行推理时操作。所提出的方法保留了标准扩散目标,并且可以集成到现有的基于适配器的扩散框架中,而无需修改主干。在 Office-31、Office-Home 和 VisDA-2017 中,VT-DUDA 比强判别性和基于扩散的 UDA 基线提高了平均目标域准确性。结果表明,在基于生成的 UDA 中,更强的条件接口可以提高合成目标类型数据的下游有用性。