论文
SHED:用于领域泛化的样式同质化嵌入对齐
SHED: Style-Homogenized Embedding Alignment for Domain Generalization
摘要
域泛化旨在通过嵌入分布变化来增强模型针对未见域的鲁棒性。虽然像 CLIP 这样的大规模视觉语言模型表现出很强的泛化性,但它们的直接图像文本嵌入对齐受到固有的信息不对称的影响:图像对类语义和特定领域的样式进行编码,而文本提示主要传达基本的类线索。这种不对称性阻碍了对现实场景中新领域的推广。为了解决这个问题,我们提出了领域泛化的风格同质化嵌入对齐(SHED),这是一种基于 CLIP 的新颖方法,可以对齐风格同质化嵌入,而不是 CLIP 中编码器的原始表示。在训练期间,SHED 从每个源域计算的图像嵌入和文本嵌入中删除特定于域的样式质心,这些文本嵌入在不同的提示模板中进行平均并去除全局质心。为了进行推理,考虑到目标域信息的缺乏,SHED 将不同的文本域质心投影到视觉空间中,并通过成员权重聚合预测。对五个基准的大量实验表明 SHED 实现了最先进的性能,显着优于先前的方法(例如,与标准 微调 相比,DomainNet 上的性能提高了 4.0%)。