论文
语言模型推理中带重置的贡献归因
Credit Assignment with Resets in Language Model Reasoning
摘要
当代可验证奖励强化学习方法通过将单一结果奖励均匀分配给轨迹中的所有token,对语言模型进行多步推理后训练。这种均匀分配忽略了哪些步骤造成了成功或失败。改进贡献归因可以解决这一局限:允许对出错的推理步骤进行针对性修正,而不是均匀更新整条轨迹。重置(reset)就是这样一种简单机制:返回某个中间状态并重采样反事实续写,使结果差异可归因于该点做出的决策,从而实现更精确的贡献归因。我们提出两种此类方法:随机重置策略优化(RRPO),其重置状态从推理步骤中随机抽取;自重置策略优化(SRPO),由模型自行定位错误轨迹中的出错步骤并在该处重置。我们在保守策略迭代(CPI)框架内分析这些方法。将CPI扩展为一个针对可改进状态的贡献归因神谕(oracle),可证明其优于随机重置。跨模型和推理基准,SRPO始终优于标准GRPO和RRPO:它在自定位的重置点采样多个后缀续写并从其奖励中学习,且只使用模型自身、无需外部监督。