论文
SPACE:用于领域适应的 CLIP 嵌入的语义投影和对齐
SPACE: Semantic Projection and Alignment of CLIP Embeddings for Domain Adaptation
摘要
部署视觉模型的一个基本挑战是域转移,当训练和测试数据遵循不同的分布时就会出现域转移,从而导致性能下降。当相同的语义概念出现在不同的视觉形式(例如照片和草图)下时,这一挑战会被放大,尽管语义对应,但视觉相似性很弱。现有的无监督领域适应方法旨在对齐跨领域的分布,但往往忽略同一类样本之间的语义关系。为了解决这个问题,本文引入了 SPACE,这是一种利用 CLIP 视觉语言空间的语义结构进行领域适应的方法。关键思想是通过将奇异值分解应用于类描述的 CLIP 嵌入,使用文本描述作为语义锚,产生捕获类别之间语义关系的正交基。 Visual features from both domains are projected into this semantic subspace, aligning images based on meaning rather than appearance.