图4:RLCER 中奖励计算过程的示意。对于问题 𝒬 \mathcal{Q} ,推理器(reasoner)生成 N N 条回复,每条回复带有思维链(CoT)𝒞 ^ k \hat{\mathcal{C}}_{k} 和最终答案 𝒜 ^ k \hat{\mathcal{A}}_{k} 。之后,评分器(rubricator)生成 K n K_{n} 条具体评分标准(rubrics)(即 ℛ ^ n ≜ { τ ^ k } k = 1 K n \hat{\mathcal{R}}_{n}\triangleq\{\hat{\tau}_{k}\}_{k=1}^{K_{n}} )。结果奖励(outcome reward)首先通过将生成的答案 𝒜 ^ k \hat{\mathcal{A}}_{k} 与真实答案 𝒜 \mathcal{A} 进行匹配来施加。所有有效的评分标准(即 𝚌𝚘𝚛𝚛 ( 𝐯 k , 𝐳 ) > α \mathtt{corr}(\mathbf{v}_{k},\mathbf{z})>\alpha 且 𝚜𝚝𝚍 ( 𝐯 k ) > 0 \mathtt{std}(\mathbf{v}_{k})>0 )被收集用于对各思维链(CoT)进行奖励。第 k k 次评分器生成中有效评分标准的比例(即 | { τ ^ n , k v a l i d } | K n \frac{|\{\hat{\tau}^{valid}_{n,k}\}|}{K_{n}} )则用于奖励评分器,使其自我演化。