论文
不偷看答案:用于无标签RLVR的结果遮盖组相对策略优化
Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR
摘要
强化学习中的可验证奖励(RLVR)提高了语言模型的推理能力,但通常依赖于真实答案(GT)来监督。无标签强化学习(Voting-based label-free RLVR)通过模型样本中的答案级共识来替代金标准监督。然而,在使用相同的答案级信号来估计奖励和驱动词元级策略优化时,会出现塌缩现象,导致模型直接强化答案词元而不是提升推理能力。我们提出了一种新的无标签强化学习框架OM-GRPO,该框架将奖励估计与策略优化分离。OM-GRPO通过软共识信号保留答案级奖励,同时在答案跨度上掩盖梯度,从而将优化压力转移到答案之外。此外,我们还引入了Contrast-Augmented Reward,这是一种通过低成本的对现有轨迹进行两两比较来改进奖励估计的方法,无需额外的回测。在各种推理基准和三种语言模型(LLM)架构上,OM-GRPO始终优于现有的无标签强化学习方法,并与金标准答案级监督训练相匹配,表现出稳定优化。这种稳定性特别有益于测试时间训练设置,在此情况下,OM-GRPO比众数投票高出4.24个点。
