论文

FBOS-RL:反馈驱动的双目标协同强化学习

FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning

模型训练强化学习

摘要

强化学习已成为调整和释放大规模模型推理能力的基石。从本质上讲,GRPO 及其变体的训练循环在采样轨迹采样和策略更新之间交替:策略首先从其操作空间中对采样轨迹进行采样,然后根据计算出的优势更新其参数。与监督学习不同,监督学习的每个梯度步骤都锚定到明确的 真值 目标,在此设置中更新模型参数的最佳梯度方向是先验未知的;因此,在采样阶段绘制的高质量卷展充当指导每个参数更新的隐式“老师”。然而,GRPO 等主流 RL 算法采用简单的采样方案,使所有采样轨迹都遵循相同的原始提示。当任务超出策略模型当前的能力时,这种采样方案很少产生高质量的采样轨迹,导致策略模型在更新其参数时没有有意义的梯度方向,从而导致训练停滞。为了解决这个问题,我们提出了 FBOS-RL。具体来说,我们让模型根据环境提供的反馈进行反馈引导的探索增强,在此基础上我们设计了两个相辅相成的训练目标:EPA 和 ECC。大量实验表明,EPA和ECC可以相互促进,形成正飞轮效应,显着提高强化学习的训练效率和最终性能上限。具体来说,在相同数量的采样轨迹和相同数量的训练步骤下,FBOS-RL 的学习速度明显快于 GRPO 和基于反馈的基线,并最终获得更高的性能上限,同时在整个训练过程中表现出更高的策略熵和更低的梯度规范。