论文

推理的动量:策略优化中的稠密内在信号

Momentum for Reasoning: Dense Intrinsic Signals in Policy Optimization

模型训练强化学习RLVR

摘要

具有可验证奖励的强化学习(RLVR)已成为在大型语言模型中引发长链推理的强大范例。然而,基于组相对策略优化(GRPO)的现有方法依赖于二元结果奖励,这会导致两种结构性故障模式:零优势崩溃(其中组中的所有采样轨迹共享相同的结果并且梯度消失)和幻觉确定性(其中模型在训练后期对不正确的采样轨迹越来越有信心)。我们通过完全根据策略自身的条件概率计算出的内在信号来强化奖励来解决这两种模式,并提出 ISPO(内在信号策略优化,它结合了序列级信号,测量思维轨迹对最终答案的信息量,与词元级方向奖励相结合,其幻觉确定性铰链惩罚关键决策词元上的自信错误的预测。在三个基本模型和五个数学推理基准中,ISPO 始终优于竞争基准,在最难的基准测试中获得最大的收益,其中零优势崩溃最常见,并且训练动态诊断证实两种故障模式都减少了。

推理的动量:策略优化中的稠密内在信号:论文配图
图 3:ISPO 框架。对于每个提示 QQ,策略 πθ\pi_{\theta} 对 GG 推出 τi=(Q,Ti,Ai)\tau_{i}=(Q,T_{i},A_{i}) 进行采样。 ISPO 通过根据 πθ\pi_{\theta} 自己的对数概率计算出的两个内在信号来增强稀疏结果奖励:序列级条件 IFD 测量思维轨迹 TiT_{i} 对答案分布的锐化程度,以及对结果不对称的关键令牌的令牌级定向奖励。复合奖励R(i)R^{(i)}进入GRPO的标准群体相对优势估计;管道的其他组件没有被修改。