论文

SokoBench:评估大语言模型的长程规划与推理

SokoBench: Evaluating Long-Horizon Planning and Reasoning in Large Language Models

模型评测智能体系统Agent任务评测基准与评测资源长程任务评测

摘要

尽管大语言模型的能力在复杂推理任务上得到越来越多的测试,但其长程规划能力尚未得到广泛研究。在本工作中,我们对最先进大型推理模型(LRM)的规划和长程推理能力进行系统评估。我们提出一个基于推箱子谜题的新基准,有意简化以将长程规划与状态持久性解耦。我们的发现揭示,当需要超过25步才能得出解决方案时,规划性能出现一致退化,提示前向规划能力存在根本约束。我们表明,为LRM配备PDDL解析、验证和求解工具可以带来适度改进,提示存在内在架构局限,可能无法仅靠测试时扩展方法克服。

SokoBench:评估大语言模型的长程规划与推理
(a)