论文
端到端学习标量奖励模型的潜在推理轨迹
Learning Latent Reasoning Traces for Scalar Reward Models End-to-End
摘要
奖励模型 (RM) 是通过强化学习使 大语言模型 与人类偏好保持一致的核心。尽管传统的标量 RM 可以实现高效且概率的奖励建模,但它们依赖于肤浅的线索,无法泛化到复杂或分布外 (OOD) 任务。相反,生成 RM 利用广泛的推理来提高挑战性任务的稳健性,但其基于自然语言的分数缺乏标量 RM 提供的数值灵活性和概率可解释性。虽然最近的方法通过 离策略 多任务学习结合了这两种范式,但这种并行优化并不能保证生成的推理轨迹主动与下游标量奖励预测保持一致或有利于下游标量奖励预测。为了解决这种不匹配问题,我们提出了 LatentRM,这是一种奖励建模框架,它将中间推理轨迹学习为离散潜在变量,以明确最大化下游标量奖励的可能性。通过对潜在推理空间进行端到端的 同策略 优化,LatentRM 将基于深度推理的评估与精确评分紧密结合起来。对分布内和 OOD 数据集以及 RLHF 的广泛验证表明,LatentRM 在从开放式对话到复杂推理等任务的偏好建模和策略调整方面优于标量、生成和混合 RM。