论文

PlanningBench:生成可扩展、可验证的规划数据以评估和训练大语言模型

PlanningBench: Generating Scalable and Verifiable Planning Data for Evaluating and Training Large Language Models

模型评测智能体系统Agent任务评测基准与评测资源长程任务评测

摘要

规划是大语言模型(LLM)的一项基础能力,因为这类复杂任务要求模型将目标、约束、资源与长期后果协调为可执行、可验证的解决方案。然而,现有规划基准通常把规划数据当作固定的实例集合,而非可控的生成目标。这限制了场景覆盖,把难度绑定在表层代理指标而非结构性来源上,并且对可扩展生成、自动验证或面向规划的训练支持有限。我们提出 PlanningBench,一个为评估与训练生成可扩展、多样且可验证规划数据的框架。PlanningBench 从真实规划场景出发,将实际工作流抽象为包含 30 多种任务类型、子任务、约束族与难度因子的结构化分类体系。在该分类体系指导下,约束驱动的合成流水线通过自适应难度控制、质量过滤与实例级验证清单来实例化自包含的规划问题。这将规划数据构建从固定的基准集合转变为可控生成,同时保持任务的现实根基。我们用 PlanningBench 评估开源与闭源前沿 LLM,发现当前模型在耦合约束下仍难以产出完整解。在评估之外,在经验证的 PlanningBench 数据上进行强化学习,可提升模型在未见规划基准及更广泛指令遵循任务上的表现。进一步分析表明,确定或定义清晰的最优解能提供更明确的奖励信号与更稳定的训练动态。总体而言,PlanningBench 为诊断和提升 LLM 的可泛化规划能力提供了可控的规划数据来源。

PlanningBench:生成可扩展、可验证的规划数据以评估和训练大语言模型:论文配图
图1:PlanningBench任务分类体系与数据分布总览,展示六大高层规划类别及各类别内具体任务类型的占比。