论文

面向更优开放式生成的成对偏好奖励与基于分组的多样性增强

Pairwise Preference Reward and Group-Based Diversity Enhancement for Superior Open-Ended Generation

模型训练强化学习

摘要

当前强化学习(RL)方法在可提供标量奖励的可验证场景中适用广泛且威力强大。然而,在开放式生成任务中,验证响应的正确性仍然困难,训练奖励模型也会带来可观的计算与标注成本。此外,可验证奖励强化学习(RLVR)常导致多样性坍缩,产生刻板或僵化的输出,这在开放域场景中尤其不可取。我们提出成对偏好奖励与基于分组的多样性增强(PPR-GDE),一种更适合开放式生成的RL方法。PPR-GDE不要求标量奖励并将组级多样性纳入奖励信号:通过成对偏好奖励保留主观评估的比较结构,通过交换响应顺序的重复比较缓解裁判位置偏差,并引入基于分组的多样性奖励以显式鼓励响应组内的语义分散;所有这些奖励信号被整合进统一的组相对策略优化目标。我们在角色扮演任务上实例化PPR-GDE,实验表明PPR-GDE相比强RL基线取得了更好的对齐质量与表达多样性。进一步分析表明,成对偏好对主观视角下的偏好对齐至关重要,而多样性度量在实现更优表达多样性和更广语义覆盖方面发挥关键作用。

面向更优开放式生成的成对偏好奖励与基于分组的多样性增强:论文配图
图 1:所提出的 PPR-GDE RL 方法概述。针对提示生成一组响应,并通过成对偏好奖励和基于组的多样性增强联合优化,从而为开放式生成任务提供稳定的强化学习。