论文

极低数据 FGVC 中的预训练目标很重要:骨干控制研究

Pretraining Objective Matters in Extreme Low-Data FGVC: A Backbone-Controlled Study

模型评测模型能力评测

摘要

极低数据细粒度分类在标签昂贵的专家领域很常见,但从业者仍然需要原则性指导来选择预训练的编码器。我们使用三个类别的标记图像的自定义数据集来研究祖母绿内含物分级,并提出问题:在匹配的骨干容量下,预训练目标如何影响下游表示质量?我们比较了经过监督分类、对比学习 (SigLIP2)、掩模重建 (MAE) 和自 蒸馏 (DINOv3) 训练的四个冻结 ViT-B/16 编码器,并使用线性和非线性探针通过留一交叉验证对其进行评估。为了控制低 N 状态下的统计噪声,我们对宏观一对一 AUC 使用排列测试 (N=1000)。监督编码器和对比编码器提供最强的线性可分离性(逻辑 AUC:0.768 和 0.735;SVM AUC:0.739 和 0.697),而 MAE 在非线性探针下得到改进(XGBoost AUC:0.713)。我们发现 DINOv3 在该域的各个探针家族中表现不佳。这些结果支持对极低数据 FGVC 的实用建议:当数据稀缺限制探测线性决策规则时,优先考虑边际执行预训练目标,并在给定数据集约束的非线性分类器可行时考虑重建式编码器。