论文

OPPO:LLM 推理中 词元级 贡献分配的贝叶斯值递归

OPPO: Bayesian Value Recursion for Token-Level Credit Assignment in LLM Reasoning

模型训练强化学习

摘要

具有可验证奖励的强化学习已成为改进 LLM 推理的标准方法,但占主导地位的算法 GRPO 为每个标记分配单一轨迹级优势,在关键推理步骤中稀释信号,并在无信息的推理步骤中注入噪声。从 同策略 蒸馏 派生的无批评替代方案通过预言机条件似然比提供每个词元信号,但将每个信号与积累到该位置的轨迹级证据隔离开来。我们提出了预言机提示策略优化(OPPO),它基于一个观察:先前的 蒸馏 式局部判别方法所使用的预言机信号也是模型对最终成功信念的自然贝叶斯更新。沿轨迹累积信号会以封闭形式并以一次额外的前向传递为代价,对每个位置的成功概率进行运行估计,并具有 词元级 优势,无需学习价值网络,也不需要额外的部署。一阶分析将优势分解为 蒸馏 方法使用的每个词元辨别信号,该信号由状态权重调制,将信用集中在真正关键的词元上,并保证方向性方差减少。该框架允许两个估计器,其区别仅在于哪个模型对证据进行评分:一个 \textit{self-oracle} ,它重用学生并恢复 同策略 蒸馏 奖励作为严格的特殊情况;以及一个 \textit{teacher-oracle} 将评分委托给更强大的冻结模型。在涵盖七个数学、科学和代码推理基准的两个基础 LLM 上,OPPO 在 AMC'23 上比 GRPO、DAPO 和 SDPO 提高了高达 $+6.0$ 点,在 AIME'24 上提高了 $+5.2$ 点,其增益随着响应长度单调扩大。