论文
用于遥感图像理解的多模态 大语言模型:特定领域还是通用?
Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?
摘要
多模态 大语言模型 (MLLM) 的快速发展为遥感图像场景理解 (RSISU) 引入了灵活的范式,实现了与遥感图像的自然语言交互。然而,仍然缺乏对现有遥感 MLLM (RS-MLLM) 的能力边界、跨任务泛化和特定任务限制的系统理解。本文对 RSISU 的 MLLM 进行了系统调查和诊断评估。我们回顾了 RS-MLLM 的技术演变,重点关注模型设计、多模态学习、训练数据和下游功能。我们进一步在不同的 RSISU 任务和基准中将 RS-MLLM 与通用计算机视觉 MLLM (CV-MLLM) 进行比较。 RS-MLLM 在特定领域的设置中仍然具有竞争力,特别是遥感视觉基础和高分辨率视觉问答。更值得注意的是,通用 CV-MLLM 在多个 RSISU 任务上可以匹配甚至超越这些专用模型,而无需特定于遥感的 微调。这些发现证明了通用 CV-MLLM 的强大可移植性,并表明当前的 RS-MLLM 在不同的 RSISU 任务中并没有始终优于它们。当前的 MLLM 还面临空间和关系推理、细粒度视觉理解、指令多样性以及跨异构任务格式的泛化等方面的限制。基于这些发现,我们概述了可靠评估、多模式和高分辨率推理、高效部署和工具增强遥感代理的未来方向。这项调查为 RSISU 开发稳健、可推广且实用的 MLLM 提供了系统参考。