论文
带有对比语言图像的在线零样本学习的标签转移感知适应 预训练 (CLIP)
Label Shift Aware Adaptation for Online Zero-shot Learning with Contrastive Language-Image Pre-Training (CLIP)
摘要
像对比语言图像 预训练 (CLIP) 这样的视觉语言模型已经在数据稀缺的场景中得到了广泛的研究。该领域一个特别具有挑战性和现实的任务是使用 CLIP 进行在线零样本学习,其中通过 CLIP 以随机顺序顺序预测未知测试样本,同时在顺序推理阶段保持特征提取和模型参数固定。此设置中的大多数现有方法通过使用传入的测试样本在线调整表示来解决该问题,同时忽略 CLIP 最初训练的数据的分布。当测试数据中的标签分布与训练域的标签分布不同时,这种不匹配可能会导致性能下降。为了解决这一差距,我们提出了标签转移感知(LSA),它将在线零样本分类任务表述为域适应问题。具体来说,LSA 将 CLIP 计算的预测(在未知源分布上进行训练)调整为仅使用未标记测试数据的目标分布,并应用标签移位校正来减轻源域和目标域之间的不匹配。跨多个数据集的广泛实验表明,所提出的 LSA 始终优于基于 CLIP 的最先进的在线零样本学习方法。