论文

重新思考无批评 RLVR 中的群体

Rethinking Groups in Critic-Free RLVR

模型训练强化学习

摘要

强化学习 (RL) 已成为 后训练 大语言模型 的核心范例。现有的无批评强化学习方法通​​常会针对同一问题生成一组 rollout,以估计优势计算的价值基线。然而,这种设计存在数据效率低下、组同步障碍以及结构化采样轨迹不灵活等问题。在这项工作中,我们重新审视“组”的作用,并表明其基本功能不仅仅是估计基线,而且还防止对负样本的错误惩罚。基于这一见解,我们提出了负词元过滤,这是一种简单有效的策略,可以实现稳定的单轨迹采样训练。我们将其应用于两种批量级优势方法,相对于基于组的 RL 技术,在推理任务上实现了可比的性能,在代理任务上实现了更强的性能。