论文
从无人机图像到农艺推理:植物表型多模态 LLM 基准
From UAV Imagery to Agronomic Reasoning: A Multimodal LLM Benchmark for Plant Phenotyping
摘要
为了改善作物遗传学,高通量、有效和全面的表型分析是关键的先决条件。虽然此类任务传统上是手动执行的,但多模式基础模型(尤其是视觉语言模型 (VLM))的最新进展使得更加自动化和稳健的表型分析成为可能。然而,植物科学对于基础模型来说仍然是一个特别具有挑战性的领域,因为它需要特定领域的知识、细粒度的视觉解释以及复杂的生物学和农艺推理。为了解决这一差距,我们开发了 PlantXpert,这是一种用于大豆和棉花表型分析的循证多模式推理基准。我们的基准测试为 VLM 的农艺适应提供了一个结构化且可重复的框架,并实现了基础模型与其领域适应模型之间的受控比较。我们构建了一个包含 385 张数字图像和 3,000 多个基准样本的数据集,涵盖疾病、害虫控制、杂草管理和产量等关键植物科学领域。该基准可以评估多种能力,包括视觉专业知识、定量推理和多步骤农艺推理。总共评估了 11 个最先进的 VLM。结果表明,特定任务的 微调 可以显着提高准确率,Qwen3-VL-4B 和 Qwen3-VL-30B 等模型的准确率高达 78%。与此同时,模型扩展带来的收益在超过一定能力后就会减少,大豆和棉花的泛化仍然不平衡,定量和基于生物学的推理继续构成重大挑战。这些发现表明 PlantXpert 可以作为评估基于证据的农艺推理和推进植物科学多模式模型开发的基础。