论文

LLM游戏智能体中的空间推理:因果上下文与多步规划的影响

Spatial Reasoning in LLM Game Agents: Impact of Causal Context and Multi-Step Planning

模型评测基准与评测资源

摘要

基于LLM的游戏智能体在较复杂任务上常常表现不佳。本工作考察这些失败是否与空间推理能力有限有关,并评估因果提示增强与多步规划能否在控制响应延迟的同时提升胜率。基于开源Qwen3模型家族,我们在不同模型规模、推理模式与规划时程下开展实验。我们进一步引入一个聚焦的GVGAI基准,由三款自定义游戏、每款五个难度级别组成,以隔离空间导航能力。评估遵循两种范式:先通过“定位实验”测试智能体找到自身精确坐标的能力,再研究游戏对局的成功率。结果表明,启用思考模式的大模型能更准确地识别自身位置,但较小模型在坐标匹配上的整体表现仍有限。胜率随游戏关卡与布局复杂度提升而下降,验证了该基准的难度分级有效性。将因果上下文融入提示往往能提升智能体成功率,对更大模型尤其明显。启用思考模式与更长规划时程能显著提升性能,而多步规划还能进一步降低每步平均响应时间,在推理深度与执行速度之间提供了实用的权衡。

LLM游戏智能体中的空间推理:因果上下文与多步规划的影响:论文配图
图 1:空间游戏中所有关卡的概述。