论文

SP3O:根据细分偏好进行强化学习,无需奖励建模

SP3O: Reinforcement Learning from Segment Preferences without Reward Modeling

模型训练强化学习

摘要

用于一般随机 MDP 的基于偏好的强化学习 (PbRL) 通常需要训练奖励模型。现有的无奖励模型方法要么仅限于老虎机或确定性 MDP,例如 DPO 或 P3O,要么使用零阶、无梯度优化,这通常比基于梯度的算法表现出更慢的收敛速度。此外,现有的基于偏好的无奖励模型的强化学习算法几乎完全使用轨迹级反馈,当轨迹很长时,这可能需要人类评估者付出巨大的努力。另一方面,分段要短得多,因此更容易比较和评估。在本文中,我们介绍了一种与分段偏好兼容的新型无奖励模型、无评论家和基于梯度的 PbRL 算法,称为分段成对近端策略优化(SP3O)。 SP3O利用分段级偏好反馈,通过离策略重要性采样构建准确的策略价值差异估计器,然后使用该估计器通过PPO型损失函数计算策略梯度。我们为算法提供了理论基础,并分析了选择段长度的权衡。我们还针对机器人控制和 LLM 微调设置中的其他 PbRL/RLHF 算法进行实验评估,以显示其改进的性能,特别是在长视野任务中。