论文

RankBuffer:开放式生成的高效基于排名的奖励

RankBuffer: Efficient Ranking-Based Rewards for Open-Ended Generation

模型训练奖励建模与过程监督

摘要

开放式生成缺乏规范的答案,使得点式奖励难以针对基于群体的强化学习进行校准。直接对相同查询rollout进行排名提供了更合适的相对奖励信号,但现有的基于排名的奖励方法可能会产生大量的判断成本。我们引入了 RankBuffer,它维护一个有序的、特定于查询的缓冲区,其中包含先前判断的响应,作为可重用的质量尺度。每个rollout首先通过独立的粗略判断插入到锚定区间中,之后只有分配到同一区间的rollout才进行局部精细排序。由此产生的完整订单将转换为有界排名奖励,而边界扩展、局部细化和非活动锚修剪会随着策略的发展而调整缓冲区。在四个开放式基准测试中,RankBuffer 始终优于所有逐点基准。它还通过最强的基于排名的奖励基准实现了几乎同等的表现,同时大幅降低了评审成本。消融证明了局部精细排名和锚点响应内容的重要性,而缓冲区分析表明,rollout衍生的锚点逐渐扩展和细化所覆盖的质量范围。这些结果将响应重用确立为高效相对奖励构建的有效方法。