论文
RemoteShield:为地球观测启用强大的多模式 大语言模型
RemoteShield: Enable Robust Multimodal Large Language Models for Earth Observation
摘要
用于地球观测的强大多模态 大语言模型 (MLLM) 应在实际输入变化下保持一致的解释和推理。然而,当前的遥感MLLM无法满足这一要求。经过精心策划的干净数据集的训练,他们学习了脆弱的映射,这些映射不能推广到可操作的地球观测中的噪声条件。因此,当部署中遇到不完美的输入时,它们的性能会下降。为了量化这种脆弱性,我们构建了一组现实的多模态扰动,包括云和雾覆盖等视觉退化,以及从口语到模糊或省略指令的各种以人为中心的文本变化。实证评估表明,这些扰动显着损害了领先的 RS 基础模型的视觉语义推理能力。为了解决这一限制,我们引入了 RemoteShield,这是一种强大的遥感 MLLM,经过训练可以在实际输入变化中保持一致的输出。在训练过程中,每个干净样本与其图像文本扰动变体配对,形成语义等价簇。 RemoteShield 不是直接拟合噪声样本,而是通过对同一集群内干净和扰动条件的偏好学习来进行优化。通过将模型响应与干净和损坏的输入进行比较,鼓励模型支持稳定响应而不是扰动引起的故障。这种跨条件对齐有助于模型专注于底层任务语义,尽管存在视觉退化和文本噪声。三项地球观测任务的实验表明,在实际多模态扰动下,RemoteShield 始终比代表性基线提供更强的鲁棒性和跨条件一致性。