论文
超越重要性采样:拒绝门控策略优化
Beyond Importance Sampling: Rejection-Gated Policy Optimization
摘要
我们提出了一个新的视角 同策略 优化:优化器应该选择哪些样本足够值得信赖来驱动策略更新,而不是通过重要性比率重新加权所有样本。基于这个观点,我们引入了拒绝门控策略优化(RGPO),它用 [0, 1] 范围内的平滑、可微的接受门 alpha_theta(s, a) = g(r_theta(s, a)) 取代了重要性采样比 r_theta = pi_theta / pi_old。与之前在训练前将拒绝采样作为数据级启发式应用的工作不同,RGPO 将拒绝提升为优化原则:门直接参与梯度计算,并与策略一起隐式更新。 RGPO提供了一个统一的框架:TRPO、PPO和REINFORCE的策略梯度都对应于有效梯度权重w(r) = g'(r) * r的具体选择。我们证明,即使重要性采样率是重尾的(其中 IS 方差发散),RGPO 也能保证有限、有界的梯度方差。我们进一步表明,RGPO 仅产生有限的、可控的偏差,并提供类似于 TRPO 的近似单调政策改进保证。 RGPO 在计算成本上与 PPO 相匹配,不需要二阶优化,并且自然地扩展到 RLHF 式的偏好对齐。在 Qwen2.5-1.5B-Instruct on Anthropic HH-RLHF(n = 3 个种子)的在线偏好 微调 中,RGPO 使用双比率门将学习锚定到先前的策略和参考模型,实现帕累托主导结果:在线 RL 方法中的最高奖励(相对于 PPO-RLHF,+14.8%)和与参考模型的最低 KL 散度(-16.0% 与 PPO-RLHF 相比,-53.1% 与 GRPO 相比)。