论文
用于微观植物图像理解的视觉语言模型基准测试
Benchmarking Vision-Language Models for Microscopic Plant Image Understanding
摘要
显微成像为在细胞和亚细胞水平上研究植物生物学和病理学提供了重要的视觉证据。然而,现有的视觉语言模型基准主要集中在宏观植物图像上,而微观领域仍未得到充分探索。为了解决这一差距,我们推出了 PlantMicro,这是一个用于评估微观植物图像中的视觉语言模型 (VLM) 的综合基准。 PlantMicro 集成了跨不同宿主、生物领域和成像模式收集的 5,000 多张图像。基于这种多样性,我们设计了一组补充任务,捕捉微观图像理解的不同方面。为了支持这些任务,我们构建了 9,000 多个 VQA 对,系统地评估 VLM 的功能。 PlantMicro 上的实验表明,当前的 VLM 难以实现细粒度识别和基于生物学的推理。例如,GPT-5 在病原体分类任务上实现了 34.93% 的准确率,仅略高于随机猜测基线。结果凸显了当前 VLM 理解植物显微图像的能力存在显着差距。 PlantMicro 为推进 VLM 实现可靠且全面的显微镜级植物理解提供了标准化基础。