论文
推理的动量:策略优化中的稠密内在信号
Momentum for Reasoning: Dense Intrinsic Signals in Policy Optimization
摘要
具有可验证奖励的强化学习(RLVR)已成为在大型语言模型中引发长链推理的强大范例。然而,基于组相对策略优化(GRPO)的现有方法依赖于二元结果奖励,这会导致两种结构性故障模式:零优势崩溃(其中组中的所有采样轨迹共享相同的结果并且梯度消失)和幻觉确定性(其中模型在训练后期对不正确的采样轨迹越来越有信心)。我们通过完全根据策略自身的条件概率计算出的内在信号来强化奖励来解决这两种模式,并提出 ISPO(内在信号策略优化,它结合了序列级信号,测量思维轨迹对最终答案的信息量,与词元级方向奖励相结合,其幻觉确定性铰链惩罚关键决策词元上的自信错误的预测。在三个基本模型和五个数学推理基准中,ISPO 始终优于竞争基准,在最难的基准测试中获得最大的收益,其中零优势崩溃最常见,并且训练动态诊断证实两种故障模式都减少了。
