论文
FusionRS:用于跨模态视觉语言学习的大规模 RGB 红外式遥感数据集
FusionRS: A Large-Scale RGB-Infrared-Style Remote Sensing Dataset for Cross-Modal Vision-Language Learning
摘要
遥感视觉语言模型具有先进的地球观测能力,但可用的大规模视觉语言资源仍然以 RGB 为中心,而互补的红外信息尚未得到充分探索。红外观测提供了独特的强度结构、物体边界和光照不变的线索,补充了传统的 RGB 图像,但大规模 RGB 红外文本资源仍然稀缺。我们推出 FusionRS,这是第一个用于受控双模态遥感视觉语言学习的大规模 RGB 红外式文本数据集。它包含 600,000 个空间对齐对,这些对是通过将不同的公共 RGB 遥感图像转换为红外式对应图像而创建的。每对保留传统的场景描述,并且一个精选子集添加了 45,913 个 IR 感知标题,描述可观察的强度、对比度、纹理和结构,同时保留场景语义。我们训练用于 RGB 红外式文本对齐的 CLIP 式模型,并采用混合任务条件字幕监督的生成视觉语言模型。评估涵盖跨模式检索、缩放和监督消融、传感器捕获传输以及严格保留的字幕和 VQA。与仅 RGB 和非红外感知设置相比,FusionRS 显着改进了 RGB 红外式对齐和红外到文本检索。消融表明,红外感知字幕改善了任务条件红外描述,展示了特定模态监督的价值。 FusionRS 为受控 RGB 红外遥感视觉语言学习提供了可扩展的基础。