论文
通过反事实推理路径减少贡献分配方差
Reducing Credit Assignment Variance via Counterfactual Reasoning Paths
摘要
使用 大语言模型 (LLM) 进行多步推理的强化学习通常依赖于稀疏的终端奖励,这会产生条件较差的贡献分配问题:最终反馈在所有中间决策中均匀传播。这导致高梯度方差、不稳定的训练和许多无效的更新,最终限制了模型的持续改进。我们提出了一个贡献分配的反事实比较框架。对于每个输入,该框架都会对多个推理轨迹进行采样,并将它们的差异视为替代决策的隐式近似。这产生了一个隐式的过程级优势估计器,它将稀疏的终端奖励转换为阶跃敏感的学习信号。在此框架的基础上,我们引入了隐式行为策略优化(IBPO),它大大提高了训练稳定性以及数学和代码推理基准的性能上限。我们的结果为释放 LLM 的推理潜力指明了一个有希望的方向。