论文
LMM模态转换:自主GIS智能体的先决条件
LMM Modality Transfer: A Pre-requisite for Autonomous GIS Agents
摘要
AI模型在理解和处理空间信息方面日益熟练,从而促进空间任务与工作流中的agentic问题求解。然而,有关其空间能力(如空间推理)的研究大多以文本模态作为输入和输出。这与人类处理GIS工作流的方式形成对比:文本与视觉模态常常被同时、交替且互补地使用。因此,要真正实现自动化的GIS分析流水线或执行人类设计的GIS工作流,AI模型——尤其是大型多模态模型(LMM)——需要能够在这些工作流中传统使用的图像模态与文本模态之间无缝转换。我们提出一个模态转换任务:(1) 要求一个LMM先对规则网格排列的彩色方块输入图像进行文字描述;(2) 再要求一个新的LMM实例依据前一模型输出的文字描述重新生成原始空间场景的图像。该任务量化了LMM在图像与文本模态之间传递空间信息的能力。最终,通过空间信息理论的视角审视LMM的模态转换能力,这项工作指出一个关键瓶颈:要在LMM中实现强大而稳健的地理空间理解,需要严格的多模态对齐。我们的结果表明,近期的LMM(此处为OpenAI的模型)在被要求重新生成简单的彩色方块空间网格图像时,仍难以完成模态转换。
