论文

AgriScope:农业图像的像素级多模态理解

AgriScope: Pixel-Grounded Multimodal Understanding for Agricultural Images

模型架构新型架构

摘要

农业图像理解需要在复杂的现实条件下对植物病害、害虫、作物结构和植物物种进行细粒度的识别。尽管多模态大语言模型 (MLLM) 最近取得了进展,但现有模型仍然仅限于纯文本输出,并且缺乏像素级视觉基础功能。在这项工作中,我们介绍了 AgriScope,一个用于农业图像理解的统一的基于像素的多模态框架。 AgriScope 在统一框架内共同支持图像级、区域级和像素级理解,支持农业图像的带像素定位的图像描述生成、引用表达分割和多轮多模态交互等任务。 AgriScope 通过生物语义编码、密集空间表示和像素解码,将生物专业语义表示与密集空间基础相结合。为了支持大规模扎根学习,我们引入了 AgriGround,这是一个大规模像素扎根农业多模式指令调整数据集,包含超过 50 万张图像和 1100 万个指令跟踪样本,涵盖植物病害分析、作物和杂草识别、害虫识别和细粒度植物学理解。 AgriGround是通过多阶段自动注释管道构建的,该管道集成了多模态字幕生成、短语级基础、分段掩码生成和面向任务的指令合成,以产生密集的基础监督。跨多个农业视觉语言任务的广泛实验证明了 AgriScope 在基于像素的多模态理解方面的有效性,为农业视觉语言学习和视觉基础建立了强有力的基准。数据集和代码将在(https://github.com/boudiafA/AgriScope)公开提供