论文

用自演化量规强化思维链推理

Reinforcing Chain-of-Thought Reasoning with Self-Evolving Rubrics

模型训练强化学习奖励建模与过程监督RLVR

摘要

尽管思维链(Chain-of-Thought,CoT)在 LLM 推理中扮演关键角色,直接对其施加奖励却很困难:训练奖励模型需要大量人工标注,而静态奖励模型(RM)难以应对不断演化的 CoT 分布和奖励劫持(reward hacking)。这些挑战促使我们寻找一种自主的 CoT 奖励方法,它既不需要人工标注投入,又能逐步演化。受近期自演化训练方法启发,我们提出 RLCER(Reinforcement Learning with CoT Supervision via Self-Evolving Rubrics,基于自演化量规的 CoT 监督强化学习),它通过自提议且自演化的量规对 CoT 施加奖励,从而增强以结果为中心的 RLVR。我们证明,即便没有结果奖励,自提议且自演化的量规也能提供可靠的 CoT 监督信号,使 RLCER 的表现超越以结果为中心的 RLVR。此外,当把这些自提议的量规用作提示内线索(in-prompt hints)时,还能进一步提升推理时表现。

用自演化量规强化思维链推理
图4:RLCER 中奖励计算过程的示意。对于问题 𝒬 \mathcal{Q} ,推理器(reasoner)生成 N N 条回复,每条回复带有思维链(CoT)𝒞 ^ k \hat{\mathcal{C}}_{k} 和最终答案 𝒜 ^ k \hat{\mathcal{A}}_{k} 。之后,评分器(rubricator)生成 K n K_{n} 条具体评分标准(rubrics)(即 ℛ ^ n ≜ { τ ^ k } k = 1 K n \hat{\mathcal{R}}_{n}\triangleq\{\hat{\tau}_{k}\}_{k=1}^{K_{n}} )。结果奖励(outcome reward)首先通过将生成的答案 𝒜 ^ k \hat{\mathcal{A}}_{k} 与真实答案 𝒜 \mathcal{A} 进行匹配来施加。所有有效的评分标准(即 𝚌𝚘𝚛𝚛 ​ ( 𝐯 k , 𝐳 ) > α \mathtt{corr}(\mathbf{v}_{k},\mathbf{z})>\alpha 且 𝚜𝚝𝚍 ​ ( 𝐯 k ) > 0 \mathtt{std}(\mathbf{v}_{k})>0 )被收集用于对各思维链(CoT)进行奖励。第 k k 次评分器生成中有效评分标准的比例(即 | { τ ^ n , k v ​ a ​ l ​ i ​ d } | K n \frac{|\{\hat{\tau}^{valid}_{n,k}\}|}{K_{n}} )则用于奖励评分器,使其自我演化。