论文
RRPO:具有分层条件生成轨迹的参考相对策略优化
RRPO: Reference-Relative Policy Optimization with Stratified Conditional Rollouts
摘要
组相对策略优化 (GRPO) 在根据可验证的反馈进行强化学习方面显示出强大的有效性,其中可以使用任务提供的正确性信号在组内比较采样的生成轨迹。然而,将与组相关的优化扩展到可验证的设置之外是具有挑战性的,因为许多任务的成功并不是由单一的正确性标准来衡量的。我们提出\textbf{参考相对策略优化(RRPO)},它通过用参考相对对比替换直接基于正确性的优势构建来概括GRPO。 RRPO 首先使用 \emph{分层条件生成轨迹} 构建正和负锚集,然后训练具有集合对比目标的度量投影头,以将候选生成轨迹与这些锚进行比较。由此产生的对齐分数直接定义了对比优势:在策略优化期间,投影头被冻结,并且分数在标准组相对目标中的每个生成轨迹组内居中。我们在整个策略优化过程中使用基于锚的对比优势来评估 RRPO,而不依赖于任务 真值 验证器。在可验证推理、开放式生成和后 SFT 设置中,RRPO 与基于验证者的优化相比仍然具有竞争力,比弱监督基线有所改进,并在监督 微调 后提供额外的收益。