论文

锦标赛-GRPO:开放式长形式生成中强化学习的分组锦标赛奖励

Tournament-GRPO: Group-Wise Tournament Rewards for Reinforcement Learning in Open-Ended Long-Form Generation

模型训练奖励建模与过程监督

摘要

开放式长格式生成中的强化学习具有挑战性,因为通常无法获得可靠的参考答案和自动指标。现有的基于评分标准的方法通常依赖于逐点 LLM 作为法官评分,但绝对分数很难在复杂的响应中进行校准,可能在相同查询的轨迹采样中提供较弱的区分度,并且在优化期间可能会变得饱和。我们提出了 Tournament-GRPO,这是一种分组奖励框架,通过在相同查询的轨迹采样中重复进行多轮锦标赛,将标题引导的 LLM 判断转换为相对奖励。锦标赛-GRPO 比较组内的候选人,累积锦标赛结果,并将其规范化为 GRPO 训练的分组奖励。 Deep Research Bench 上的实验表明,Tournament-GRPO 始终优于现有的奖励设计基线,总体得分比最强基线提高了 4.52 分。进一步的分析表明,锦标赛奖励提供了有利的有效性——效率权衡,并且锦标赛设计会影响训练动态。这些结果表明,规则引导的锦标赛比较为开放式长格式生成中的强化学习提供了有效的奖励信号。