视觉Transformer与卷积神经网络在物种丰富、数据匮乏的植物区系中进行细粒度兰花属识别:新几内亚兰科植物的受控基准
Vision Transformers versus convolutional neural networks for fine-grained orchid genus identification in a species-rich, data-poor flora: a controlled benchmark on the Orchidaceae of New Guinea
摘要
新几内亚是世界上植物群最丰富的岛屿(约 2,856 种兰花),但大多数物种仅由少数照片表示,远远低于直接物种级别分类所需的数量。需要对这些物种丰富、数据匮乏的植物群进行细粒度识别的方法,但目前尚不清楚哪种主干架构和预训练策略最能支持它们。我们构建了一个两阶段系统,首先预测查询照片的属,然后使用 FAISS 检索候选物种的视觉上相似的参考图像。我们比较了四个预训练的主干——两个 Vision Transformer(ViT;DINOv2、BioCLIP 2)和两个 CNN(ConvNeXt V2-L、EfficientNetV2-L)——在相同的协议下对涵盖 120 个属和 1,350 个物种的 16,701 张照片的固定物种分层分区进行微调,评估准确性、校准、错误结构、物种检索和开放集检测小说属。 DINOv2 获得了最好的属性能(宏观 top-1 66.9%,95% CI 63.7-70.6;全局 top-1 88.9%);两个 ViT 的排名都超过了 CNN,通用自监督预训练 (DINOv2) 的表现比领域匹配的生物预训练 (BioCLIP 2) 好 7.1 个宏观 top-1 点。错误集中在作为错误吸引子的两个丰富的属上。 DINOv2 嵌入实现了 86.6% 的物种 Recall@5 和 98.7% 的属 Recall@5;温度缩放将每个骨干网的预期校准误差降低至约 0.03;以及基于距离的开集门标记了未见过的属(平均 AUROC 0.958)。自我监督的 Vision-Transformer 主干与嵌入检索相结合,是一种有效的、可部署的策略,用于在物种丰富、数据匮乏的植物群中进行细粒度识别。该系统作为开放网络应用程序(新几内亚兰花标识符)发布,为其他高度多样化、记录不足的分类群提供实用模板。