论文
Range-GRPO:通过奖励区间之间的成对关系进行策略优化
Range-GRPO: Policy Optimization via Pairwise Relations among Reward Intervals
摘要
随着大语言模型 (LLM) 的使用不断扩大,后期训练对于使其适应下游任务变得越来越重要。然而,获得可靠的监督仍然成本高昂,特别是在没有参考答案或可执行验证器的领域。 LLM-as-a-Judge 为未标记的响应提供可扩展的伪奖励,但单分分数并不明确代表奖励的不确定性。这促使将伪奖励表示为共形校准的奖励范围。我们提出了 Range-GRPO,这是一种半监督的后训练框架,它将有限的标记数据与未标记的提示相结合。在组相对策略优化(GRPO)中,学习信号取决于每个rollout组内的相对奖励比较。所提出的目标是成对比较奖励范围,而不是将它们减少为点奖励,从而允许区间不确定性影响这些信号的幅度和方向。我们的理论分析描述了这种区别,并表明当所有奖励范围缩减为点数时,所提出的目标恢复了 Dr$.$GRPO 优势。根据经验,Range-GRPO 在评估的半监督方法中实现了最高的分布内和分布外平均性能,同时需要较少的训练资源。