论文

结果奖励不能保证推理过程可验证或真正影响答案

Outcome Rewards Do Not Guarantee Verifiable or Causally Important Reasoning

模型训练模型评测强化学习奖励建模与过程监督模型行为与机制分析RLVR

摘要

思维链上的可验证奖励强化学习已成为语言模型后训练的常见组成部分,但训练后的推理文字是否可靠地反映答案形成过程,仍需要检查。本文提出两项指标:推理的因果重要性(CIR),衡量推理词元对最终答案的累积影响;推理的充分性(SR),衡量验证器只依据推理过程能否确定明确答案。 在Qwen2.5模型与ReasoningGym任务中,RLVR提高了任务准确率,却没有稳定提高CIR和SR。先进行少量监督微调能够改善较低的指标;在结果奖励之外加入CIR或SR辅助奖励,也能在保持任务准确率的同时,得到对答案更有实际影响、更充分的推理过程。研究据此说明,结果奖励与推理过程的可靠性需要分别衡量,并提供相应改进方法。

图1:推理文字对答案的实际影响,以及只依据推理能否确定答案的两项指标。
原论文配图;作者:Qinan Yu, Alexa Tartaglini, Peter Hase, Carlos Guestrin, Christopher Potts。图1:推理文字对答案的实际影响,以及只依据推理能否确定答案的两项指标。