论文

TomaMMU:番茄叶病的综合多模式理解基准

TomaMMU: A Comprehensive Multimodal Understanding Benchmark for Tomato Leaf Diseases

模型评测基准与评测资源

摘要

为了解决这一差距,我们引入了 TomaMMU(一个大规模番茄叶病多模态理解数据集)以及 TomaBench(用于评估 VLM 对番茄病害理解的基准)。 TomaMMU 包含跨越 15 个类别的 28,808 张高质量图像和 213,119 个人工注释的视觉问答对,这些图像是通过包括数据收集、人工注释和问答生成的三阶段管道生成的。在此基础上,TomaBench将七项农业任务组织成涵盖基本感知、病理学理解和专家诊断的分层三级分类法,这些分类法共同实现了从基础视觉识别到高层诊断推理的系统评估。这些任务评估视觉症状识别、分类关系和诊断推理,提供模型掌握植物病理学的全面视图。我们的结果表明,14 个最先进的 VLM 在细粒度识别和基于事实的推理方面存在差距,在具有挑战性的 MCQ 和开放式问题上始终表现不佳。这些结果表明,当前的 VLM 很难将视觉感知转化为可靠的诊断知识,从而激发了对目标领域适应的需求。 TomaMMU 上的简单 微调 大大缩小了这一差距,将具有挑战性的 MCQ 的准确性提高到 96.09%,优于最近的 VLM,并为未来的工作指明了有希望的方向。所有数据和代码均可在 https://huggingface.co/datasets/enalis/TomaMMU 中找到。