论文

DDO-RM:奖励学习后的分配级策略改进

DDO-RM: Distribution-Level Policy Improvement after Reward Learning

模型训练偏好优化

摘要

最近的理论表明,当奖励函数在统计上比诱导策略更简单时,奖励模型优先方法可以比直接策略拟合更具样本效率。我们提出了 DDO-RM,一种有限候选决策优化方法,可将奖励分数转换为明确的目标分布。与基于 PPO 的 RLHF 或 DPO 不同,DDO-RM 执行 KL 正则化镜像下降更新,以将策略投影到候选集上的奖励改进分布。 Pythia-410M 上的初步实验表明,DDO-RM 在配对准确度(0.52 至 0.56)和平均间隔(0.13 至 0.53)方面优于 DPO。我们的框架提供了奖励学习和镜像下降政策改进之间的原则性联系。