论文

MAgSeg:使用多模态 大语言模型 高分辨率卫星图像中的农业景观分割

MAgSeg: Segmentation of Agricultural Landscapes in High-Resolution Satellite Imagery using Multimodal Large Language Models

模型训练监督微调与指令调优

摘要

南半球国家的农业景观分割具有挑战性,因为其特点是地块分散、类内方差高以及标记训练数据稀缺。 Multimodal 大语言模型 (MLLM) 在分割方面取得了最新进展。然而,当前的方法在理解卫星特征时遇到了关键的上下文长度瓶颈和域对齐差距。我们通过 MAgSeg 解决了这些限制,这是一种新颖的、无解码器的 MLLM 分割方法。 MAgSeg 是一种架构上高效的方法,使标准 MLLM 能够根据高分辨率卫星图像对复杂的小农农业景观进行分割,而无需辅助视觉解码器。我们引入了一种新颖的指令调整数据格式,旨在在高分辨率卫星图像上实现可扩展的 微调 和 后训练,这使得 MAgSeg 能够从图像的全局上下文中学习,同时仅为图像中的补丁生成文本标记。对跨越全球南方三个国家的数据集进行的广泛评估表明,MAgSeg 的性能显着优于最先进的 MLLM 基线,为绘制小农农业环境提供了可扩展的解决方案。