论文

StaRPO:稳定性增强的强化策略优化

StaRPO: Stability-Augmented Reinforcement Policy Optimization

模型训练强化学习

摘要

强化学习(RL)在提升大语言模型复杂推理任务准确率方面卓有成效。现有RL策略优化框架依赖最终答案正确性作为反馈信号,很少捕捉推理过程的内部逻辑结构。因此,模型会生成流畅且语义相关的回答,却在逻辑上不一致、结构上紊乱或内容冗余。为此,我们提出StaRPO,一个把推理稳定性显式纳入优化目标的稳定性增强强化学习框架。我们的StaRPO将稳定性分解为两个可计算的轻量指标:自相关函数(Autocorrelation Function, ACF)用于评估局部逐步连贯性,路径效率(Path Efficiency, PE)用于评估推理轨迹的全局目标导向性。这些稳定性奖励与任务奖励相结合,提供互补且过程感知的反馈。我们通过在两个骨干模型上展示ACF与PE奖励同逻辑错误之间的相关性,验证了使用这两种奖励的有效性。在四个推理基准上的实验表明,StaRPO持续优于对比基线,能够同时提升最终答案准确率与逻辑稳定性。

StaRPO:稳定性增强的强化策略优化:论文配图
图1:展示三类逻辑错误的示例,用以说明强化学习优化中模型推理出现的典型错误模式。