论文
注意空间推理与行动之间的鸿沟!基于Spatial-Gym的智能体逐步评估
Mind the Gap Between Spatial Reasoning and Acting! Step-by-Step Evaluation of Agents With Spatial-Gym
摘要
空间推理对导航与机器人技术至关重要,然而在这些任务上度量模型能力仍然困难。现有基准在单次(one-shot)设定下评估模型,要求在单次响应中生成完整解答,这与在交互环境中逐步工作的人类不同。我们提出Spatial-Gym,一个Gymnasium环境,它通过将2D网格谜题中的寻路作为带可选回溯的序贯决策任务来测试,从而隔离出空间约束推理。我们在500个回合上,以人类、随机策略和A*为基线,在三种设定(单次、逐步、带回溯的逐步)下评估了八个模型。最佳模型GPT-OSS 120B取得16.0%的求解率,比人类基线(98.0%)低82个百分点。逐步格式通过消除格式错误帮助较弱模型(最多+5.4%),却通过约束全局规划损害较强模型(最多5.6%)。回溯改善了回合完成率,但仅对较弱模型提升求解率;较强模型很少回溯,也未从中受益。我们的实验有三个关键发现:(1) 模型无法随难度提升而相应增加推理投入;(2) 接收空间环境图像的视觉模型求解率下降73%;(3) 即使在逐步设定下,扩展的思维链推理仍保持较标准推理3-5倍的准确率优势。Spatial-Gym使得诊断模型局限成为可能,并为通过强化学习改进空间推理提供了框架。