论文

从对比的角度重新审视具有可验证奖励的强化学习

Revisiting Reinforcement Learning with Verifiable Rewards from a Contrastive Perspective

模型训练强化学习

摘要

组相对策略优化(GRPO)是 后训练 大语言模型 在推理任务中最广泛采用的 RLVR 算法之一。我们首先表明 GRPO 承认等效的歧视性重新制定,其中政策优化最大化了经过验证的积极和消极采样轨迹之间的预期分数差距。这种重新表述揭示了两个客观水平的限制:可能性错位的替代分数,其中基于截断比率的分数被优化,而不是控制生成的序列可能性,以及分数不敏感的贡献分配,其中采样轨迹水平信用不反映正和负采样轨迹之间的当前分数差距。为了解决这些限制,我们提出了 ConSPO,一种对比序列级策略优化方法,该方法使用长度归一化序列对数概率作为采样轨迹分数,并将经过验证的积极采样轨迹与同一组内的负面干扰因素进行对比。 ConSPO 优化了分组 InfoNCE 风格的目标,以自适应地加强对分离不佳的阳性和高分阴性的更新,以及课程安排的余量,以随着训练的进展保留分离压力。跨不同设置的实验表明,ConSPO 在具有挑战性的推理基准上优于强大的基线。