论文
OGER:用于混合强化学习的鲁棒离线引导探索奖励
OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning
摘要
带可验证奖励的强化学习 (RLVR) 的最新进展显着改进了大语言模型 (LLM) 推理,但模型往往难以探索超出其初始潜在空间的新轨迹。虽然已经提出了离线教师指导和熵驱动策略来解决这个问题,但它们通常缺乏深度集成或受到模型固有能力的限制。在本文中,我们提出了 OGER,这是一种新颖的框架,通过专门的奖励建模镜头将离线教师指导和在线强化学习结合起来。 OGER 采用多教师协作训练,构建辅助探索奖励,利用离线轨迹和模型自身的熵来激励自主探索。跨数学和一般推理基准的广泛实验表明,OGER 显着优于竞争基准,在数学推理方面取得了巨大的进步,同时保持了对域外任务的稳健泛化。我们提供训练动态的全面分析,并进行详细的消融研究,以验证我们的熵感知奖励调制的有效性。我们的代码可在 https://github.com/ecoli-hit/OGER.git 获取。
