论文
通过 Advantage Sign Robustness 缓解 RLHF 中的 奖励作弊
Mitigating Reward Hacking in RLHF via Advantage Sign Robustness
摘要
用于根据人类反馈 (RLHF) 进行强化学习的奖励模型 (RM) 很容易受到 奖励作弊 的影响:随着策略最大化学习到的代理奖励,真实的质量会趋于稳定或下降。我们假设 奖励作弊 通常是由翻转的优势符号引起的:翻转的符号不会减少不良响应的可能性,而是会导致更新增加不良响应的可能性。通过考虑 RM 参数空间中的对抗性扰动,我们可以得出经过认证的符号保留半径,这是在策略优化期间可以翻转优势符号的最小扰动。基于这个公式,我们提出了优势符号认证策略优化(SignCert-PO),在策略梯度更新中降低非鲁棒完成的权重。与需要多个 RM 或访问 RM 训练数据的先前方法不同,SignCert-PO 是轻量级的,并且仅使用 RM 参数和 同策略 完成在策略优化阶段纯粹运行。在 TL;DR 总结和 AlpacaFarm 基准测试中,SignCert-PO 始终获得比基线更好的获胜率,并减少了 奖励作弊。