CropVLM:用于开放集作物分析的领域适应视觉语言模型
CropVLM: A Domain-Adapted Vision-Language Model for Open-Set Crop Analysis
摘要
高通量植物表型分析,即可观察植物性状的定量测量,对于现代育种至关重要,但仍然受到“表型分析瓶颈”的限制,其中手动数据收集是劳动密集型的,并且容易出现观察者偏差。传统的封闭式计算机视觉系统无法应对这一挑战,因为它们需要大量的物种特异性注释,并且缺乏处理不同育种种群的灵活性。为了弥补这一差距,我们提出了 CropVLM,这是一种通过领域特定语义对齐 (DSSA) 适应农业领域的视觉语言模型 (VLM)。 CropVLM 在自然田间条件下对涵盖 37 个物种的 52,987 个手动选择的图像标题对进行训练,有效地将农艺术语映射到细粒度的视觉特征。我们进一步介绍了混合开放集定位网络(HOS-Net),这是一种集成了 CropVLM 的架构,能够仅根据自然语言描述来检测新作物,而无需重新训练。通过消除对特定物种训练数据的依赖,CropVLM 为高通量表型分析提供了可扩展的解决方案,加速了遗传增益并促进了可持续农业所必需的大规模生物多样性研究。训练好的模型权重和完整的管道实现可在以下位置公开获取:[https://github.com/boudiafA/CropVLM](https://github.com/boudiafA/CropVLM)。在综合评估中,CropVLM 实现了 72.51% 的零样本分类准确率,优于七个 CLIP 式基线。我们的检测管道展示了对新物种的卓越零样本泛化,在我们的 CVTCropDet 基准上实现了 49.17 AP50,在热带水果物种上实现了 50.73 AP50,而次佳方法分别为 34.89 和 48.58。