论文

群体边缘化自我奖励强化学习驱动零标签自我进化

Group-Marginalized Self-Rewarding RL Drives Zero-Label Self-Evolving

模型训练强化学习

摘要

自我奖励强化学习 (RL) 使大语言模型 (LLM) 能够在没有人类标签的情况下自我进化。现有的基于集成的方法从rollout组构建奖励参考并相应地分配奖励。然而,响应的奖励表示还取决于其随机采样的组上下文,即其组中的其他响应。仅使用一种群体上下文实现可能会错过所需的奖励信号,并为策略优化提供不可靠的指导。为了解决这个问题,我们提出了群体边缘化优势估计(GMAE),它将可能的背景下的奖励实现汇总到响应级别分布中,并估计预期优势。八个基准测试和四个基本模型的实验展示了强大的性能和跨领域泛化能力。 GMAE 还表现出稳定的学习、低额外成本以及跨训练数据集和 RL 主干的良好适用性。