论文
Sentinel2Cap:用于多模态遥感图像描述的人工注释基准数据集
Sentinel2Cap: A Human-Annotated Benchmark Dataset for Multimodal Remote Sensing Image Captioning
摘要
图像字幕已成为计算机视觉中的一项重要任务,使模型能够生成视觉内容的自然语言描述。虽然自然图像和高分辨率光学遥感图像存在多个数据集,但多模态卫星数据的字幕数据集的可用性仍然有限,特别是对于 SAR 图像和中分辨率传感器。我们介绍了 Sentinel2Cap,这是一个人工注释的多模态字幕数据集,包含具有不同土地覆盖组成的 10 m 和 20 m 空间分辨率的 Sentinel-1 SAR 和 Sentinel-2 多光谱图像块。字幕是手动创建并经过仔细验证的,以确保语义准确性和语言质量。为了评估 Sentinel2Cap,我们使用 Qwen3-VL-8B-Instruct 模型在三种图像模态上执行零样本字幕:RGB、多光谱和 SAR 伪 RGB 表示。结果表明,RGB 图像实现了最高的字幕性能,而 SAR 图像对于视觉语言模型来说仍然更具挑战性。提供特定于模态的上下文提示可以持续提高所有指标的性能。这些发现凸显了多模态遥感图像字幕的挑战以及人工注释数据集对于推进跨模态场景理解研究的潜在价值。所有材料都是公开的。