论文

正确不够:用执行器依据对齐奖励训练推理规划器

Correct Is Not Enough: Training Reasoning Planners with Executor-Grounded Rewards

模型训练强化学习奖励建模与过程监督RLVR

摘要

具有可验证奖励的强化学习已成为改进大语言模型中显式推理的常用方法,但仅最终答案的正确性并不能揭示推理轨迹是否忠实、可靠或对使用它的模型是否有用。这种仅结果的信号可以强化因错误原因而正确的轨迹,通过奖励捷径夸大推理收益,并在多步骤系统中传播有缺陷的中间状态。为此,我们提出了 TraceLift,这是一个规划器执行器训练框架,它将推理视为可消耗的中间工件。在规划器训练期间,规划器发出标记推理。冻结的执行器将这种推理转化为验证者反馈的最终工件,而基于执行器的奖励则形成中间轨迹。该奖励将基于标题的推理奖励模型 (RM) 分数乘以同一冻结执行器上测量到的提升,从而获得高质量且有用的痕迹。为了使推理质量可以直接学习,我们引入了 TRACELIFT-GROUPS,这是一个根据数学和代码种子问题构建的带有标题注释的纯推理数据集。每个示例都是一个相同的问题组,包含高质量的参考轨迹和多个可能有缺陷的轨迹,这些轨迹具有局部扰动,会降低推理质量或解决方案支持,同时保留任务相关性。对代码和数学基准的大量实验表明,这种基于执行器的推理奖励比仅执行训练改进了两阶段规划器-执行器系统,这表明推理监督不仅应该评估跟踪是否看起来不错,还应该评估它是否有助于使用它的模型。

正确不够:用执行器接地奖励训练推理规划器
图 1:TraceLift-Groups 和 TraceLift 的整体框架。 (a) TraceLift-Groups 的数据管理管道。然后,我们使用 TraceLift-Groups 来微调专门用于通过设计损失进行推理监督的奖励模型。 (b) 使用先前训练的推理奖励模型对规划器进行 GRPO 训练过程。 (c)执行计算过程的细节。 Reasoning RM 分数由测量的执行器提升进行加权,然后与验证者反馈相结合以进行规划器优化。