将感知视觉专家与多模态 LLM 相融合,进行可解释的植物病害诊断:从基准图像到现实世界的机器人现场验证
Fusing Perceptual Vision Experts with Multimodal LLMs for Explainable Plant Disease Diagnosis: From Benchmark Imagery to Real-World Robotic Field Validation
摘要
准确的田间植物病害诊断需要可靠地融合不确定和相互矛盾的感知证据。我们提出了混合分层多代理框架 (H$^{2}$MAF),将 EfficientNet-B3 和 ConvNeXt-Tiny 的决策级融合与开放权重多模态 大语言模型 (MLLM)、Gemma 4 E4B 和 Qwen3.5 4B 的语义仲裁相结合,使用结构化 JSON 证据来生成可解释的诊断、风险级别、治疗紧迫性和财务风险。 (H$^{2}$MAF) 在 PlantDoc(2,922 个图像,27 个类别)和两个非公开、连续捕获的康奈尔机器人采集的田间数据集:第 2 阶段(20 GB;4,215 个图像)和第 4 阶段(40 GB;7,227 个图像)的 14,364 个图像(1,370 个测试图像)上进行评估,涵盖不受控制的早疫病、晚疫病和壳针孢叶斑病现场条件。在 PlantDoc 上,Gemma 将准确率从 63.9% 提高到 68.5%,在 41.7% CNN 冲突子集上获得 +7.6 分。康奈尔大学的准确率达到 99.3% 和 98.9%,只有 1.7-4.1% 的分歧,证明了冲突相关的 MLLM 效用。 Gemma 的临界风险误差为 0.14-0.5 分,而 Qwen 则超出了 3.5-14.4 分。这些结果表明 MLLM 仲裁是一种有前途但依赖于校准的方法,用于可解释的农业人工智能和机器人领域决策支持。 Github 链接:https://github.com/Applied-AI-Research-Lab/Explainable-AI-Plant-Disease-Detection