论文

PARM:流水线适配奖励模型

PARM: Pipeline-Adapted Reward Model

模型训练奖励建模与过程监督

摘要

奖励模型(RM)是使大语言模型(LLM)与人类偏好对齐的核心,为RLHF和高级解码策略提供支撑。尽管以往工作大多聚焦于单步生成,现实应用却日益采用多阶段LLM流水线,而有效的奖励引导在这些场景中仍未被充分探索。我们通过面向组合优化的代码生成来研究这一问题,构建了一条将奖励模型同时集成到建模(formulation)与求解两个阶段的流水线。我们识别出一个关键挑战:奖励模型预测与实际流水线执行结果之间的不一致。为解决这一问题,我们提出流水线适配奖励模型(Pipeline-Adapted Reward Model,PARM),它利用流水线特定数据和直接偏好优化使奖励与下游反馈对齐。我们将PARM实例化为两阶段流水线(建模->代码生成),并在四个公开优化基准上评估,对照基线和采样方法测量执行率与求解准确率。补充性的GSM8K跨域实验评估了可迁移性。结果表明,PARM持续提升流水线输出的质量与稳定性,为多阶段LLM推理的奖励建模提供了新的见解。

PARM:流水线适配奖励模型:论文配图
图 2:给出具体优化问题的拟议管道的图示。该图显示了整个工作流程,从问题陈述(左上)开始,通过大语言模型(LLM)自动生成多个问题表述和候选解决方案,再到使用奖励模型对其进行评估和选择。提供了每个阶段的示例输出,包括候选配方和解决方案,以及最终选定的(黄金)配方和解决方案。