论文

植物图像表示的自监督学习

Self-Supervised Learning of Plant Image Representations

模型训练预训练

摘要

自动化植物识别在生物多样性监测和保护中发挥着至关重要的作用,但目前的方法严重依赖监督学习,而这受到专家标记数据可用性的限制。自监督学习(SSL)提供了一种可扩展的替代方案,但现有的方法和训练协议主要是为粗粒度的视觉任务而设计的,可能无法很好地转移到植物物种识别等细粒度的领域。在这项工作中,我们研究了用于植物图像表示学习的 SSL。我们表明,SSL 管道中常用的增强(例如高斯模糊、灰度转换和日光化)在植物图像的背景下是有害的,因为它们消除了细粒度识别所必需的微妙区分线索。相反,我们确定了更适合该领域的替代变换,包括仿射和色调分离。我们进一步证明,在 iNaturalist 2021 Plantae 子集上训练 SimDINOv2 产生的表征明显强于在 ImageNet-1K 上训练,这凸显了 SSL 领域特定数据的重要性。我们的研究结果在 ViT-Base 和 ViT-Large 架构中都是一致的。此外,我们的模型在少数镜头设置下的下游植物识别任务中实现了具有竞争力的性能,有时甚至优于强监督基线 Pl@ntCLEF 和 BioCLIP。总体而言,我们的结果强调了自监督学习中适应领域的增强策略和数据集选择的至关重要性,并为构建可扩展的生物多样性监测模型提供了实用指南。