论文

BigEarthNet.txt:大规模多传感器图像文本数据集和地球观测基准

BigEarthNet.txt: A Large-Scale Multi-Sensor Image-Text Dataset and Benchmark for Earth Observation

模型评测基准与评测资源

摘要

视觉语言模型(VLM)在计算机视觉(CV)方面表现出了强大的性能,但由于缺乏具有多种文本注释的大规模、多传感器遥感(RS)图像文本数据集,其在遥感(RS)数据上的性能仍然有限。现有数据集主要包括航空红-绿-蓝图像,带有简短或弱的说明文字,并且注释类型的多样性有限。为了解决这一限制,我们引入了 BigEarthNet$.$txt,这是一个大规模、多传感器图像文本数据集,旨在跨多个任务推进地球观测中指令驱动的图像文本学习。 BigEarthNet$.$txt 包含 464044 个共同注册的 Sentinel-1 合成孔径雷达和 Sentinel-2 多光谱图像,以及 960 万个文本注释,包括: i) 描述土地利用/土地覆盖 (LULC) 类别、其空间关系和环境背景的带地理依据的图像描述; ii)与不同任务相关的视觉问答对; iii) 用于边界框预测的参考表达检测指令。通过比较统计分析,我们证明 BigEarthNet$.$txt 在文本丰富度和注释类型多样性方面超越了现有的 RS 图文数据集。我们进一步建立了手动验证的基准分割来评估 RS 和 CV 中的 VLM。结果显示了这些模型在涉及复杂 LULC 类的任务上的局限性,而使用 BigEarthNet$.$txt 的 微调 可以在所有考虑的任务中实现一致的性能提升。