多少在线强化学习就足够了? RLVR 中离线偏好优化的信息发布
How Much Online RL is Enough? Informative Rollouts for Offline Preference Optimization in RLVR
摘要
可验证奖励强化学习 (RLVR) 已成为语言模型推理的强大范例,GRPO 就是其主要示例。然而,GRPO 需要连续的在线部署生成,这使得计算成本高昂且难以扩展。虽然直接偏好优化 (DPO) 提供了稳定且高效的离线替代方案,但通常预计其性能会低于 w.r.t.。在线 RL 方法(例如 GRPO)在冷监督微调(SFT)策略中进行部署训练。我们引入了 G2D(GRPO 到 DPO)},这是一个三阶段管道,可以执行简短的 GRPO 预热、构建静态偏好数据集,并使用 DPO 离线微调模型。在 Qwen2.5-7B 和 Llama-3.1-8B 上 GRPO 中的一组在线步骤数 (K) 值中,我们发现在我们的设置中,具有适度预热的离线 DPO 可以匹配或优于 GRPO,且计算成本要低得多。在 Qwen2.5-7B 上,K=150 时的 G2D 在 MATH-500 上达到 62.4%,比 GRPO(51.6%)高出 10.8%,而计算量却低了约 4 倍。在 Llama-3.1-8B 上,K=500 时的 G2D 达到 49.4%,超过了我们实验设置中的 GRPO。我们表明,性能不受偏好对数量的影响,偏好对的数量变化不大。 K,但通过它们的信息量。适度的预热会产生具有校准不确定性的采样轨迹,从而产生更强的对比信号,而过度的预热会导致政策过度自信和信息量较少的数据。我们的结果将 RLVR 中的离线与在线差距重新定义为主要的数据信息问题,并通过对 微调 数据集进行适当的难度校准来确定短暂的在线 RL 预热,作为在线 RL 的计算高效替代方案。