论文

通过打破尾部对齐来改进 CLIP 适应,实现无源跨域少样本学习

Improving CLIP Adaptation by Breaking Tail Alignment for Source-Free Cross-Domain Few-Shot Learning

模型训练监督微调与指令调优

摘要

CLIP 等视觉语言模型 (VLM) 表现出强大的零样本泛化能力,但在目标域训练数据稀缺的跨域场景中,其性能显着下降(跨域少样本学习,CDFSL)。在本文中,我们重点关注基于 CLIP 的 CDFSL 任务中的目标域小样本微调。流行的微调范例将所有图像补丁标记与其相应的文本嵌入统一对齐。然而,我们发现了一个违反直觉的现象:积极地将某些低相似度图像标记(称为“尾部标记”)从文本嵌入中剔除,不断提高目标域性能。我们深入研究了这一现象,并提供了一种新颖的解释:在领域变化较大和训练数据稀缺的情况下,模型很难从视觉输入中提取语义信息;因此,对齐的共同信念仅对已经包含足够语义信息的标记有效;对于尾部标记,强制对齐会导致对稀缺训练的过度拟合,而破坏对齐则更有用。受此启发,我们提出了自适应尾头对齐(ATHA),这是一种针对 CLIP 的新颖的 微调 策略,它将传统的统一对齐范式转变为自适应对齐范式,同时增强对齐和削弱对齐。对四个具有挑战性的 CDFSL 基准进行的大量实验验证了我们最先进的性能。我们的代码可在 https://github.com/shuaiyi308/ATHA 获取。