论文

语义兼容的 知识蒸馏,用于使用视觉基础模型进行跨域目标检测

Semantically Compatible Knowledge Distillation for Cross-Domain Object Detection with Vision Foundation Models

摘要

视觉基础模型 (VFM) 为域自适应对象检测 (DAOD) 提供强大的泛化能力。然而,现有的基于 VFM 的方法忽视了教师和学生特征图之间的空间尺度差异,导致语义不兼容,削弱了特征对齐和伪标签学习。此外,域转移可能会导致经过源训练的 VFM 教师错过目标域对象,从而限制了其伪标签的质量。为了解决这些问题,我们提出了语义本地化增强教师(SLE-T),这是一个围绕 DINOv2 的轻量级 SLE 适配器构建的语义兼容的知识 蒸馏 框架。 SLE Adapter 将预训练的局部纹理先验注入 DINOv2,以改进跨域识别,并将其特征重新表述为在空间和语义上与学生检测器兼容的密集表示。 SLE-T 通过伪标签学习或特征对齐来传输由此产生的教师知识。我们用 DINOv2-B 和 DINOv2-L(ViT-B 和 ViT-L 变体)实例化 SLE-T,并将它们与更大的 DINOv2-G 教师进行比较。对三个 DAOD 基准的大量实验表明,我们的方法实现了最先进的性能,消融研究证实了师生语义兼容性的重要性。值得注意的是,带有 DINOv2-B 的 SLE-T 使用大约 DINOv2-G 四分之一的训练时间和更少的 GPU 内存来生成具有竞争力或优越的伪标签,从而在有限的计算资源下展示了高效的 VFM 知识传输。