论文
WeedExpert-R1:通过强化学习激励 MLLM 中的植物推理以实现精准杂草定位
WeedExpert-R1: Incentivizing Botanical Reasoning in MLLMs with Reinforcement Learning for Precision Weed Grounding
摘要
精准杂草控制需要物种级识别和实例级定位。然而,传统的物体检测器使用封闭的词汇,限制了它们跨区域的部署,并且无法解释它们在复杂农业场景中的预测。多模态 大语言模型 (MLLM) 提供视觉基础和推理能力,但植物学知识不足可能会导致细粒度杂草识别产生幻觉。本研究引入了 WeedExpert-R1,这是一种多模式模型,可通过可验证的奖励来学习基于视觉的植物推理。特定领域的思想链合成管道将人工策划的植物性状字典与审核合成器 LLM 工作流程相结合,为受监督的 微调 生成推理数据。然后应用组相对策略优化,并对格式、准确性、实例计数和响应长度进行奖励。在 6 个数据集的 37 种杂草中,WeedExpert-R1-4B 在 IoU 阈值为 0.5 时实现了 75.82% 的精确集精度、89.30% 的精度和 87.81% 的召回率。它的性能优于专有模型(包括 GPT-5.4 和 Gemini-3.1-Pro)以及更大的开源模型(包括 Qwen3-VL-30B-Instruct 和 Gemma-4-31B-it)。对未见过的物种的结果进一步证明了其开放词汇能力以及无需再训练即可在不同地区和作物上部署的潜力。