论文
Dyna-DINO:通过自适应表示锚定实现高效 ViT 蒸馏
Dyna-DINO: Efficient ViT Distillation Via Adaptive Representation Anchoring
摘要
具有 Vision Transformer (ViT) 主干的视觉基础模型 (VFM)(例如 DINOv2)已成为对象识别和语义分割等下游任务的关键。主干网巨大的计算要求通常需要将 蒸馏 融入更小的架构中以进行边缘部署。基于特征的知识蒸馏(KD)经常受到师生差距的影响;由于能力有限,学生很难模仿老师的复杂特征图。为了缓解这一瓶颈,我们提出了 Dyna-DINO:通过自适应表示锚定实现高效 ViT 蒸馏,这是基于 ViT 特征的 知识蒸馏 的训练课程。通过利用教师的中间特征图作为一系列逐渐困难的目标,我们的课程允许学生在处理更高级别的抽象之前建立基础表示。我们的结果表明,这种范式通过跨不同学生模型大小和数据集规模的自适应难度选择显着加速了收敛。通过我们的课程,Dyna-DINO 蒸馏 ViT-S 在 ImageNet-100 上实现了 90.1% 的准确率,与基线相比提高了 12.24%。在 ImageNet-1K 上,Dyna-DINO 在 Oxford 和 Paris 数据集上的实例检索任务上实现了 +3.9% 和 +6.09% 的改进,在语义分割任务上实现了 +1.93% 的改进,并且在分类任务上实现了有意义的性能提升。此外,通过在训练的初始阶段实施教师推理提前停止,该课程可以在 ImageNet-100 上节省 25.1% 的训练 FLOP 和 21% 的训练时间。代码可在 https://github.com/KevinZ0217/Dyna-DINO 获取