论文
在地图上思考:基础模型 Agent 如何探索、记忆与推理地图环境
Thinking on Maps: How Foundation Model Agents Explore, Remember, and Reason Map Environments
摘要
地图环境为表示空间结构提供了基本媒介。因此,理解基础模型(FM)Agent 如何理解并在此类环境中行动,对于实现可靠的基于地图的推理和应用至关重要。然而,现有对 FM 空间能力的评测大多依赖静态地图输入或基于文本的查询,忽视了空间理解的交互性和经验驱动特性。本文提出一个交互式评估框架,分析 FM Agent 如何在符号地图环境中探索、记忆和推理。Agent 逐步探索由道路、交叉口和兴趣点(POI)组成的部分可观测网格地图,每步只接收局部观测。随后使用六类空间任务评估空间理解能力。通过在多个基础模型上系统变化探索策略、记忆表征和推理方案,我们揭示了这些组件的不同功能角色。探索主要影响经验获取,但对最终推理准确性的影响有限。相比之下,记忆表征在固化空间经验方面起核心作用,结构化记忆尤其是序列和基于图的表征,显著提升路径规划等结构密集型任务的表现。推理方案进一步决定存储的空间知识如何被使用,高级提示支持更有效的多步推理。我们进一步观察到,空间推理性能在超过某个能力阈值后在不同模型版本和规模上趋于饱和,这表明地图类空间理解的改进需要针对空间表征和推理定制的机制,而非单纯扩大规模。