论文

OGER:用于混合强化学习的鲁棒离线引导探索奖励

OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning

模型训练强化学习奖励建模与过程监督RLVR

摘要

带可验证奖励的强化学习 (RLVR) 的最新进展显着改进了大语言模型 (LLM) 推理,但模型往往难以探索超出其初始潜在空间的新轨迹。虽然已经提出了离线教师指导和熵驱动策略来解决这个问题,但它们通常缺乏深度集成或受到模型固有能力的限制。在本文中,我们提出了 OGER,这是一种新颖的框架,通过专门的奖励建模镜头将离线教师指导和在线强化学习结合起来。 OGER 采用多教师协作训练,构建辅助探索奖励,利用离线轨迹和模型自身的熵来激励自主探索。跨数学和一般推理基准的广泛实验表明,OGER 显着优于竞争基准,在数学推理方面取得了巨大的进步,同时保持了对域外任务的稳健泛化。我们提供训练动态的全面分析,并进行详细的消融研究,以验证我们的熵感知奖励调制的有效性。我们的代码可在 https://github.com/ecoli-hit/OGER.git 获取。

OGER:用于混合强化学习的鲁棒离线引导探索奖励
图1:OGER框架的整体架构。我们首先根据多个教师模型生成的轨迹构建一个全面的、高质量的离线数据集,并通过将在线采样轨迹和离线参考映射到共享表示空间来计算散度来执行混合离线-在线集成。这种分歧是我们探索奖励和线下替换的基础。此外,我们利用最后一个token的香农熵来细化探索奖励,从而提供训练信号的细粒度、不确定性感知调制。