论文

通过半监督基础模型 蒸馏 训练学生专家

Training a Student Expert via Semi-Supervised Foundation Model Distillation

摘要

基础模型提供了强大的感知能力,但通常计算量太大而无法部署,并且调整它们通常需要昂贵的注释。我们引入了半监督 知识蒸馏 (SSKD) 框架,该框架使用有限的标记和丰富的未标记数据将预训练的视觉基础模型 (VFM) 压缩为紧凑的专家,并实例化它,例如在每像素标签特别昂贵的情况下进行分割。该框架分三个阶段展开:(1)通过对比校准的自我训练实现 VFM 的领域适应,(2)通过统一的多目标损失进行知识转移,以及(3)学生细化以减轻残留的伪标签偏差。我们方法的核心是实例感知的像素级对比损失,它融合掩模和类别分数以提取信息负片并强制执行清晰的实例间裕度。通过在适应和 蒸馏 中保持这种对比信号,我们可以对齐教师和学生的嵌入,并更有效地利用未标记的图像。在 Cityscapes 和 ADE20K 上,我们的 $\approx\times$ 较小的学生比零样本 VFM 教师提高了 +11.9 和 +8.6 AP,比适应教师提高了 +3.4 和 +1.5 AP,并且在基准测试中优于最先进的 SSKD 方法。