论文
PS-PPO:用于无批评 RLHF 的前缀采样 PPO
PS-PPO: Prefix-Sampling PPO for Critic-Free RLHF
摘要
大语言模型 的人类反馈强化学习 (RLHF) 越来越依赖无批评者方法作为行动者-批评者训练的实用替代方案。尽管它们很简单,但现有的无批评方法在轨迹中的所有标记上均匀地传播轨迹级学习信号。这需要每条采样轨迹后进行全轨迹策略更新,从而导致长推理跟踪的大量优化成本,即使中间前缀通常包含足够的信息来很大程度上确定最终结果。我们提出了前缀采样近端策略优化(PS-PPO),这是一种利用这种时间冗余的 RLHF 计算高效、无批评的方法。 PS-PPO 引入了即时条件截止分布,并对每个轨迹的截止时间步长进行采样。在更新过程中,PS-PPO 仅通过每个轨迹的采样前缀进行反向传播,并应用重要性加权校正,以便生成的截断梯度估计器相对于全轨迹目标保持无偏。数学推理和 RLHF 基准测试表明,PS-PPO 大幅减少了训练计算量和峰值 GPU 内存,同时保持了与强大的无批评基线相当的准确性。