论文

用于作物病虫害诊断的可配置多级视觉管道

Configurable Multi-Stage Vision Pipeline for Crop Disease and Pest Diagnosis

应用与实践行业应用

摘要

FarmerChat 是 Digital Green 为小农户提供的农场咨询服务。当农作物出现问题时,农民会拍一张照片并将其发送出去,而这张照片就是整个问题:没有描述任何症状,没有命名农作物,通常根本没有文字。该服务必须根据廉价手机在田野中、光线不佳和移动相机拍摄的图像来确定该图片是否可以使用、它显示的是什么作物以及它有什么问题。今天执行此操作的系统无法调整。它没有可调整的照片拒绝阈值,无法添加裁剪和问题,并且没有可设置的置信度截止值。我们研究了从埃塞俄比亚、印度、肯尼亚和尼日利亚发送到 FarmerChat 的约 116 万张照片。生产质量门拒绝了其判断的 46.8% 的图像,超过四分之一的达到诊断结果的图像没有返回作物名称,并且在“疾病”项下标记的问题中,35.8% 是害虫,无需作物即可识别。因此,我们将工作分为三个阶段:质量门(M0)、作物检测器(M1)和疾病或害虫检测器(M2)。路线 A 通过一个经过微调的视觉语言模型 (Qwen3-VL-4B) 在一次呼叫中应答来满足这三个要求。路线 B ​​各填充一个小型专业模型(DaViT、YOLO26)。我们将生产的 GPT-4o 质量门替换为小型 MobileNetV3 门,在 12 毫秒内达到 86.9% F1。在一个测试集上,每个系统的得分都相同,分层 DaViT-Base 的裁剪准确率达到 95.41%,而生产基线的准确率则为 91.46%。它还引导诊断并且从不拒绝回答,而比较中的每个语言模型都会留下很大一部分没有诊断的行。经过微调的模型保留了专家所没有的两项功能:一次调用所有三个阶段,以及当图像无法支持答案时请求更好的照片。