论文

LMM模态转换:自主GIS智能体的先决条件

LMM Modality Transfer: A Pre-requisite for Autonomous GIS Agents

模型评测模型能力评测

摘要

AI模型在理解和处理空间信息方面日益熟练,从而促进空间任务与工作流中的agentic问题求解。然而,有关其空间能力(如空间推理)的研究大多以文本模态作为输入和输出。这与人类处理GIS工作流的方式形成对比:文本与视觉模态常常被同时、交替且互补地使用。因此,要真正实现自动化的GIS分析流水线或执行人类设计的GIS工作流,AI模型——尤其是大型多模态模型(LMM)——需要能够在这些工作流中传统使用的图像模态与文本模态之间无缝转换。我们提出一个模态转换任务:(1) 要求一个LMM先对规则网格排列的彩色方块输入图像进行文字描述;(2) 再要求一个新的LMM实例依据前一模型输出的文字描述重新生成原始空间场景的图像。该任务量化了LMM在图像与文本模态之间传递空间信息的能力。最终,通过空间信息理论的视角审视LMM的模态转换能力,这项工作指出一个关键瓶颈:要在LMM中实现强大而稳健的地理空间理解,需要严格的多模态对齐。我们的结果表明,近期的LMM(此处为OpenAI的模型)在被要求重新生成简单的彩色方块空间网格图像时,仍难以完成模态转换。

LMM模态转换:自主GIS智能体的先决条件:论文配图
图1:展示所提模态迁移任务流程的示意图。输入图像以不同配置和批量大小生成。随后它们与一段指示AI如何生成合适文本描述的文本提示一起作为Prompt 1的输入。Prompt 1的输出作为Prompt 2的输入,其中文本描述被用于生成新图像。最后,Prompt 1(文本)和Prompt 2(图像)的生成输出均对照原始输入图像进行评估。