论文
教授:视觉语言模型的多教师无监督提示 蒸馏
The Professor: Multi-Teacher Unsupervised Prompt Distillation for Vision-Language Models
摘要
Prompt 蒸馏 通过匹配教师对未标记域图像的预测,将大型视觉语言模型 (VLM)(例如 CLIP)压缩为轻量级学生模型。 PromptKD (CVPR 2024) 通过一名经过 PromptSRC 微调的 ViT-L/14 教师和一名 ViT-B/16 学生建立了这种范例。我们提出了 TheProfessor,一个多教师扩展,它从固定的两个教师集合中提取出来:一个域微调的 PromptSRC ViT-L/14 教师和一个零样本 EVA-CLIP-L/14 教师,其 logits 是根据数据集预先计算的。我们在四个基础数据集(Caltech-101、DTD、UCF101 和 EuroSAT)上评估单教师 PromptKD、等概率集成和置信加权集成。在 12 轮单种子扫描中,置信加权集成将平均 HM 从 87.52 提高到 89.28(+1.77 分),而等平均将平均 HM 提高到 88.88(+1.37 分)。增益取决于数据集:在 Caltech-101 上可以忽略不计(置信权重为 +0.16 HM),在 UCF101 上增益不大(+0.62),在域转移 EuroSAT 上增益最大(+5.78)。这些结果更新了我们之前仅在加州理工学院进行的分析,并表明当第二位教师在领域转移下提供补充监督时,多教师提示 蒸馏 最有用。