论文
重新思考工业检测的迁移学习:跨 RGB 和 X 射线任务的 DINOv3 与 ImageNet 预训练
Rethinking Transfer Learning for Industrial Inspection: DINOv3 vs. ImageNet Pretraining Across RGB and X-ray Tasks
摘要
在网络规模数据上预训练的视觉基础模型最近在许多下游任务上显示出强大的传输能力,但其对工业视觉检测的有效性仍不清楚。工业数据与网络数据有很大不同,通常需要细粒度的密集预测,这就提出了一个问题:现代自监督预训练是否可以改进基于监督 ImageNet 初始化的传统迁移学习范式。在这项工作中,我们将预训练的 ConvNeXt 主干与监督 ImageNet 分类或 DINOv3 蒸馏 进行比较,并将它们与传统的 ResNet-50 基线相关联。我们评估了涵盖 RGB 表面缺陷检测和 X 射线缺陷检测的四个下游数据集的语义分割、实例分割和对象检测。我们进一步研究了冻结和完全微调的适应机制。我们的结果表明,DINOv3 在冻结传输方面没有明显的优势,但在对 RGB 任务进行全面微调后提供了更强的初始化,从而产生更快的收敛和更好的最终性能。然而,在 X 射线模态转变下,有监督的 ImageNet 预训练在冻结和微调设置中仍然更有效。总的来说,我们的研究结果表明,现代视觉基础模型在监督 RGB 工业检查方面很有前景,但它们的可转移性很大程度上取决于下游适应和目标模式。