论文

农业图像解释和生成任务中多模态 LLM 的幻觉行为

Hallucination Behavior in Multimodal LLMs Across Agricultural Image Interpretation and Generation Tasks

模型评测模型行为与机制分析

摘要

大语言模型 (LLM) 正在农业成像应用中迅速采用,范围从作物解释到合成田间图像生成。然而,这些模型经常表现出幻觉输出,这些输出看起来很自信,但却偏离了生物或环境现实,可能导致错误的农艺见解。这项研究从两个互补的方向研究了此类幻觉:图像到文本,其中 LLM 解释作物或田地图像来描述生物和非生物胁迫等条件,以及文本到图像,其中模型根据描述性提示生成合成农业场景。我们检查涉及生物不一致、上下文不准确和农艺不合理的错误,并根据多种成像模式的领域知情标准评估输出。我们的分析确定了解释性任务和生成性任务中反复出现的幻觉模式。在图像解释中,LLM(例如,Gemma、LLAVA、Qwen 和 MiniCPM)实现了适度的零射击精度(63% 至 75%),而少数射击提示的性能提高高达 86.8%,表现出错误检测和漏感染,表明残留的幻觉效应。在文本到图像任务中,GPT-5 和 Gemini 2.5 Flash 等先进模型在宽松的提示约束下生成高达 91% 的生物不一致场景,揭示了当前 LLM 的根本弱点。这种对视觉推理和生成的系统评估为增强基于 LLM 的农业成像平台的可靠性和可信度提供了重要的见解。