论文
超越外观:多模态 大语言模型 能否利用垂直结构进行遥感自然场景理解?
Beyond Appearance: Can Multimodal Large Language Models Exploit Vertical Structure for Remote Sensing Natural Scene Understanding?
摘要
多模态 大语言模型 (MLLM) 在遥感分析方面进展迅速,但现有评估仍然主要以 2D 为中心。由于光谱混淆区域可能看起来几乎相同,但在垂直结构上却存在很大差异,因此仅凭外观通常不足以在自然场景中进行可靠的语义解释。因此,垂直结构提供了决策关键的物理证据,但当前的 MLLM 是否能够有效地感知、基础和利用这些几何证据仍有待探索。为了弥补这一差距,我们引入了VertiCue-Bench,这是第一个使用受控干预来探究垂直高度证据是否被真正感知、扎根和利用的诊断基准,并建立了感知-扎根-利用的三阶段证据利用框架。通过构建涵盖多种呈现和交互模式(包括原始视觉、工具辅助和 Oracle Text 条件)的表征干预谱,以及受控的反事实测试,我们对 10 个最先进的模型进行了深入的理清诊断。我们的实验揭示并正式表征了垂直结构利用差距。尽管当前模型表现出新兴的几何感知能力,但它们仍然难以准确地将垂直证据提供给相关空间实体并将其集成到高级语义决策中。这一发现确定了开发物理符合物理约束的和几何感知遥感 MLLM 的关键瓶颈。