论文
JURY-RL:投票提议、证明裁决的无标签RLVR
JURY-RL: Votes Propose, Proofs Dispose for Label-Free RLVR
摘要
可验证奖励强化学习(RLVR)能增强大语言模型(LLM)的推理能力,但标准RLVR通常依赖人工标注答案或精心编制的奖励规范。在机器可验证的领域,多数投票或LLM作为裁判等无标签替代方案省去了标注成本,却可能引入破坏训练稳定性的假阳性。我们提出JURY-RL,一个将答案提议与奖励裁决解耦的无标签RLVR框架:来自模型rollout的投票提出候选答案,由形式化验证器决定该候选能否获得正奖励。具体而言,只有当多数投票选出的答案在Lean中验证成功时,与之匹配的rollout才获得奖励。当验证无定论时,我们启用ResZero(Residual-Zero),一种后备奖励:丢弃未获验证的多数提议,并在其余答案上重新分配零均值、保方差的信号。这一设计在维持稳定优化梯度的同时,不会强化无法验证的共识。在三个于数学数据上训练的骨干模型中,JURY-RL在数学推理基准上持续优于其他无标签基线,并能以有竞争力的表现迁移到代码生成与通用基准。其pass@1表现与有监督真值训练相当,并通过更高的pass@k与回答多样性展现出更强的泛化能力。
