论文
AgroVG:农业视觉视觉定位的大规模多源基准
AgroVG: A Large-Scale Multi-Source Benchmark for Agricultural Visual Grounding
摘要
视觉基础是通过自然语言表达描述的对象进行本地化的任务,是农业人工智能系统的一项基本功能,可实现选择性除草、疾病监测和定向收割等应用。农业视觉基础的可靠评估仍然具有挑战性,因为农业目标通常很小、重复、被遮挡或形状不规则,并且说明可能涉及图像中的一个、多个或没有对象。因此,评估这种能力需要联合测试定位准确性、目标集完整性和存在感知弃权。为了解决这些挑战,我们引入了 \textbf{AgroVG},这是一个多源基准,它将农业视觉定位制定为广义集预测:给定图像和引用表达式,模型必须返回所有匹配的目标实例,或者在不存在目标时放弃。 AgroVG 包含来自 6 个目标科的 10 个源数据集的 10{,}071 个基于注释的图像查询对:作物/杂草、水果、麦穗、害虫、植物病害和树冠。它支持所有六个系列的边界框视觉定位 (T1),以及具有可靠实例级像素注释的源上的实例掩码视觉定位 (T2),查询涵盖单目标、多目标和目标缺失状态。 AgroVG 还提供用于框集匹配和查询级掩码覆盖的特定于任务的协议。对涵盖闭源 MLLM、开源 VLM 和专用视觉定位系统的 26 个模型配置的零样本评估揭示了持续存在的差距:最佳多目标 Set-$F_1$ 仅达到 0.35,而 IoU@0.75 时的最佳正查询掩模成功率仍低于 0.17。数据和代码可在 https://anonymous.4open.science/r/AgroVG-5172/ 获取。