论文

GRLO:从零开始在开放环境中迈向可推广的强化学习

GRLO: Towards Generalizable Reinforcement Learning in Open-Ended Environments from Zero

模型训练强化学习

摘要

后训练 已成为解锁 大语言模型 功能的关键一步,强化学习 (RL) 已成为关键范例。最近基于强化学习的 后训练 逐渐分为两种范式:来自人类反馈的强化学习 (RLHF),它使用目标域中的人类偏好信号来优化模型;以及来自可验证奖励的强化学习 (RLVR),它在验证者支持的环境中运行。后者在最近面向推理的 后训练 中占据主导地位,因为它在特定领域的任务(例如推理)上提供了更强的增益和更高的效率。然而,尽管域内强化学习训练取得了可喜的性能,但它仍然需要大量的 GPU 计算,这仍然是广泛采用的主要障碍。在这项工作中,我们研究了 RLHF 从开放环境中的一小组交互中从头开始学习的泛化能力,并研究它显式获得的会话能力是否可以隐式转移到数学推理和代码生成等下游任务,即 GRLO。具体来说,在 Qwen3-4B-Base 主干上,GRLO 将所有域的平均性能从 24.1 提高到 63.1,仅需要 5K 提示和 22.7 个 GPU 小时,与强大的域内 RLVR 基准相比,所需数据减少约 46 倍,计算量减少约 68 倍。由此产生的模型甚至可以与 Qwen 发布的训练后模型相媲美,后者需要更大的训练成本。值得注意的是,随后的域内 RLVR 阶段仅带来选择性收益,主要是在更激烈的竞争数学基准上。我们希望 GRLO 提供一个简单而有效的方法来构建具有广泛能力的训练后模型。我们的代码和数据将位于:\href{https://github.com/SJY8460/GRLO}{https://github.com/SJY8460/GRLO}。