论文

评估和增强遥感 MLLM 中的否定理解

Evaluating and Enhancing Negation Comprehension in Remote Sensing MLLMs

模型评测基准与评测资源

摘要

多模态 大语言模型 (MLLM) 在各种遥感 (RS) 任务中取得了显着的成功。然而,它们理解否定的能力仍未得到充分探索,限制了模型在现实应用中的部署,在现实应用中,模型必须明确识别错误或不存在的内容,例如,紧急响应人员需要找到未被洪水淹没的疏散路线。为了全面研究这一限制,我们引入了 RS-Neg,这是第一个评估跨区域级到场景级任务的否定理解的基准。具体来说,我们为遥感图像设计了一个自动数据生成管道,使用 LLM 来合成各种否定查询,并引入动态视觉焦点模块进行验证。我们的评估表明,先进的 RS MLLM 与否定作斗争,表现出幻觉和显着的性能下降。为了弥补这一差距,我们提出了 NeFo,一种新颖的测试时学习方法,它明确地将否定的逻辑角色纳入模型优化中。值得注意的是,NeFo 使用大约 5% 的未标记测试样本,显着提高了模型的否定理解,并对未见过的任务表现出很强的泛化能力。