论文

流程奖励模型满足规划:为阶梯级奖励生成精确且可扩展的数据集

Process Reward Models Meet Planning: Generating Precise and Scalable Datasets for Step-Level Rewards

模型训练奖励建模与过程监督

摘要

过程奖励模型 (PRM) 已成为评估 大语言模型 (LLM) 推理时提供步骤级反馈的强大工具,即使最终答案正确,也会经常产生包含错误的思想链 (CoT)。然而,现有的 PRM 数据集的构建成本仍然很高,容易出现注释错误,并且主要局限于数学领域。这项工作引入了一种新颖且可扩展的 PRM 数据集生成方法,该方法基于以规划域定义语言 (PDDL) 表达的规划逻辑问题。使用这种方法,我们生成了跨各个 PDDL 域的大约一百万个推理步骤的语料库,并用它来训练 PRM。实验结果表明,使用 PDDL 派生数据增强广泛使用的 PRM 训练数据集可以在数学和非数学推理方面产生显着改进,正如多个基准测试所证明的那样。这些发现表明,规划问题构成了一种可扩展且有效的资源,可以为 PRM 生成稳健、精确和细粒度的训练数据,超越了主导该领域的经典数学来源。