论文
BiasGRPO:经组相对策略优化稳定高方差奖励地貌中的偏见缓解
BiasGRPO: Stabilizing Bias Mitigation in High-Variance Reward Landscapes via Group-Relative Policy Optimization
摘要
减轻大型语言模型 (LLM) 中的社会偏见带来了明显的一致性挑战:与可验证的任务不同,偏见缺乏单一的基本事实,从而产生了高方差、主观奖励景观。以前基于偏好的微调方法存在重大权衡:直接偏好优化(DPO)由于缺乏离线训练固有的探索而受到限制,而近端策略优化(PPO)可能由于潜在不可靠的批评家估计而导致训练不稳定。在本文中,我们提出了 BiasGRPO,这是一个使用组相对策略优化(GRPO)的框架,通过规范一组采样完成的奖励来稳定一致性。通过用相对于组的基线代替价值函数,我们的方法减少了不稳定性,同时保持了在线训练的探索优势。我们发现 BiasGRPO 在多个基准测试中均优于 DPO 和 PPO,这表明了其有效性。为了适应 GRPO,我们综合扩展了跨越多个领域和上下文的数据集。我们还创建并发布了一个自定义偏差奖励模型,该模型可以有效地指导生成,同时具有较高的计算效率并避免知识退化,从而提供可以无缝集成到多目标 RLHF 管道中的宝贵资源。
