论文
GeoNLI - 卫星图像的自然语言解释器
GeoNLI - A Natural Language Interpreter for Satellite Imagery
摘要
多模态多任务模型在遥感数据集上表现出了强大的性能。然而,由于这些模型是在异构数据上进行训练的,并且因任务而异,因此设计一个在字幕、视觉问答 (VQA) 和视觉基础方面表现良好的统一模型仍然具有挑战性。在这项工作中,我们在 VRS Bench 和 NWPU-VHR-10 数据集上评估了多个模型。 EarthMind 模型在字幕和 VQA 方面都表现出了强劲的成果。为了视觉定位,我们提出了多个管道 - RemoteSAM-SAM-v1、RemoteSAM-SAM-v2 和 DiffuSAM - 并最终在 EarthMind、RemoteSAM、SAM3、Falcon、RemoteSAM-SAM3-v1、RemoteSAM-SAM3-v2 和 DiffuSAM 预测中采用多数投票集成。我们统一的模块化管道将先进的 SAM 变体与多模式 LLM 集成在一起,共同执行字幕、VQA 和视觉定位。它的字幕准确率达到 82%,VQA 准确率达到 83.32%,二进制、数字和语义问题类型的准确率分别为 90.94%、52.04% 和 92.06%。对于视觉定位来说,它的准确度达到了64.94%。通过整体多数投票,将不同的 VLM 与我们的定制 RemoteSAM-SAM3 模型相结合,该系统可提供比特定任务方法更准确、一致的遥感理解。