论文
MAP:面向长时域交互式智能体推理的先建图后行动范式
MAP: A Map-then-Act Paradigm for Long-Horizon Interactive Agent Reasoning
摘要
当前的交互式LLM智能体依赖目标条件的逐步规划,其中对环境的理解是在执行期间被动获取的,而非事先建立。这种时间倒置导致延迟环境感知(Delayed Environmental Perception):智能体必须通过试错来推断环境约束,形成使其陷入低效失败循环的认知瓶颈(Epistemic Bottleneck)。受人类可供性感知和认知地图理论启发,我们提出先建图后行动范式(Map-then-Act Paradigm,MAP),一个将环境理解提前到执行之前的即插即用框架。MAP由三个阶段组成:(1)全局探索,获取环境通用先验;(2)任务特定建图,构建结构化认知地图;(3)知识增强执行,基于地图求解任务。实验显示在多个基准和LLM上均有一致的收益。在ARC-AGI-3上,MAP使前沿模型在25个游戏环境中的22个超越了接近零的基线性能。我们进一步引入MAP-2K——一个先建图后行动轨迹数据集——并表明在其上训练优于专家执行轨迹,这说明理解环境比模仿更根本。
