论文
AgroGround:农业场景中的多粒度视觉定位与识别
AgroGround: Multi-Granularity Grounded Recognition in Agriculture
摘要
农业视觉模型通常针对识别或定位进行评估,但可靠的诊断需要识别存在的内容并定位证据。农业视觉问答(VQA)数据集带有丰富的语义标签,但很少将它们链接到图像区域,并且手动添加此类注释在规模上成本高昂。我们介绍 AgroGround,这是一个用于视觉定位农业识别的大型数据集:识别植物病害和其他农业目标并定位其图像区域。自动化管道将八个农业 VQA 数据集的标签转换为疾病病变和整个对象的注释,生成 794,850 个指令示例。健康图像为疾病查询提供负面监督,教导模型返回空预测。我们微调是一个基于已知目标视觉定位指令的共享视觉语言模型,并结合了需要识别和定位的指令。我们在与所有训练数据不相交的 1,480 个经过人类验证的图像上评估预测的身份、区域、联合正确性和健康图像弃权。仅视觉定位的微调将识别准确率从 51.8\% 降低到 29.1\%,而添加识别和定位指令将其提高到 72.6\%。在图像和注释保持固定的情况下,结合两种格式可将联合精度从 19.2% 提高到 43.3%(在可比较的基础上)。健康底片将健康图像的弃权率提高到 95.0%,强化学习提高了病变级视觉定位。生成的 2B 模型在我们的基准测试和外部 PlantSeg 测试集上的 视觉定位F1指标上超出了其注释教师模型。 AgroGround 建立了视觉定位农业识别的基准,衡量身份和定位的联合正确性以及对健康图像的弃权。代码可在 https://github.com/AB-Abdulla/AgroGround. 获取
