论文

AgriChain 视觉基础专家验证可解释农业视觉语言模型的推理

AgriChain Visually Grounded Expert Verified Reasoning for Interpretable Agricultural Vision Language Models

模型训练合成数据

摘要

准确且可解释的植物病害诊断仍然是现实农业中视觉语言模型(VLM)的主要挑战。我们介绍 AgriChain,这是一个包含大约 11,000 个专家策划的叶子图像的数据集,涵盖不同的作物和病理,每个图像都与 (i) 疾病标签、(ii) 校准的置信度得分(高/中/低)和 (iii) 专家验证的思想链 (CoT) 基本原理配对。解释草案首先由 GPT-4o 生成,然后由专业农业工程师使用标准化描述符(例如病变颜色、边缘和分布)进行验证。我们在 AgriChain 上对 Qwen2.5-VL-3B 进行微调,产生了一个名为 AgriChain-VL3B 的专门模型,以联合预测疾病并生成基于视觉的推理。在 1,000 张图像测试集上,我们的 CoT 监督模型实现了 73.1% 的 top-1 准确率(宏 F1 = 0.466;加权 F1 = 0.655),优于包括 Gemini 1.5 Flash、Gemini 2.5 Pro 和 GPT-4o Mini 在内的强大基线。生成的解释与专家推理紧密结合,始终引用关键视觉线索。这些发现表明,经过专家验证的推理监督显着提高了准确性和可解释性,缩小了通用多模式模型与人类专业知识之间的差距,并为可持续农业推进了值得信赖、可在全球部署的人工智能。数据集和代码可公开获取:https://github.com/hazzanabeel12-netizen/agrichain