论文
视觉语言模型的领域不变即时学习
Domain-Invariant Prompt Learning for Vision-Language Models
摘要
像 CLIP 这样的大型预训练视觉语言模型通过在共享特征空间中对齐图像和文本来改变计算机视觉,通过提示实现强大的零镜头传输。软提示,例如上下文优化 (CoOp),通过学习一组上下文向量,有效地使这些模型适应下游识别任务。然而,CoOp 缺乏明确的机制来处理未知发行版之间的域转移。为了解决这个问题,我们提出了域不变上下文优化(DiCoOp),这是针对域泛化优化的 CoOp 的扩展。通过采用对抗性训练方法,DiCoOp 迫使模型学习领域不变的提示,同时保留分类的判别力。实验结果表明,DiCoOp 在跨不同视觉领域的领域泛化任务中始终优于 CoOp。