论文

根据人类反馈进行安全强化学习的策略梯度原始对偶方法

Policy Gradient Primal-Dual Method for Safe Reinforcement Learning from Human Feedback

模型训练强化学习

摘要

来自人类反馈的安全强化学习(Safe RLHF)最近通过解耦人类对有用和无害的偏好,在开发有用和无害的 大语言模型 方面取得了经验上的成功。现有方法通常依赖于根据人类反馈拟合固定范围奖励模型,并且仅经过经验验证。在本文中,我们将安全 RLHF 表述为无限视野贴现约束马尔可夫决策过程 (CMDP),因为人类可以通过连续的交互序列而不是在单个有限事件内与模型进行交互。我们提出了两种安全 RLHF 算法,它们不需要奖励模型拟合,并且与假设固定长度轨迹的先前工作相比,支持灵活的轨迹长度进行训练。两种算法都基于原对偶方法,并在策略梯度迭代、轨迹样本长度和人类偏好查询方面以多项式速率实现全局收敛保证。据我们所知,这是第一个在人类反馈下研究无限视野贴现 CMDP 并建立全局非渐近收敛的工作。