论文

过程奖励模型的可控且可验证的过程数据合成

Controllable and Verifiable Process Data Synthesis for Process Reward Models

模型训练奖励建模与过程监督

摘要

过程奖励模型(PRM)依赖于高质量的过程监督数据,但现有的构建方法通常对错误位置、错误类型和轨迹一致性提供有限的控制。我们提出了一个可控且可验证的框架来合成 PRM 的过程监督数据。我们的框架首先构建正确的符号推理链,将模板感知错误注入中间步骤,在损坏状态下重新计算后续步骤,并验证注入的步骤不可从其前缀推导。生成的配对轨迹在第一个错误时是前缀无效的,但在符号重新计算后保持轨迹一致,并被转换为对齐的自然语言过程以进行 PRM 训练和评估。实验表明,合成数据改进了逻辑推理基准上的 Best-of-8 重新排名,并转移到了数学推理。步骤级评估进一步表明,首次错误定位仍然比整体步骤分类更具挑战性,这凸显了对细粒度和可验证过程监督的需要。

过程奖励模型的可控且可验证的过程数据合成
图 1:拟议的用于 PRM 监管的可控且可验证的过程数据合成框架概述。