论文
OpenJev-RLCD:一个有效的 RLCD 实现
OpenJev-RLCD: A Working RLCD Implementation
摘要
Jev 等决策模型用概率回答问题,只有经过校准后才有用。开源复制依赖于监督微调和温度缩放,而来自可验证奖励的强化学习(RLVR)使推理模型过于自信。我们提出了用于推理模型的校准决策强化学习(RLCD)的有效实现:该模型对一个基本原理进行采样,然后我们使用严格正确的评分规则对其承诺的答案分布进行评分。方差恒等式表明,对多个样本的混合进行评分会奖励不同的理由,并且 RLVR 正是这种混合目标,而没有其多样性术语。天真地优化后,基于基本原理的目标要么关闭推理,要么被政策梯度噪音淹没,这导致了一个两阶段的方案:校准,然后强化。使用 Qwen3-1.7B 在两个推理任务(3 个种子、配对测试)上,RLCD 在准确性上匹配或击败了 SFT、RFT/STaR 和 GRPO(每个都有温度标度),并在选择性预测中击败了所有这些任务;在 GSM8K 答案验证中,单个查询以 $\le$5\% 错误决定 81\% 的项目,而 GRPO 的 19\% 则为错误。当注释者的分歧带来不确定性时,RLCD 显然无法击败交叉熵。代码和结果:https://github.com/ZimmyGao/openjev-rlcd.