GFlowRL:缩放分布 - 将 RL 匹配到 大语言模型
GFlowRL: Scaling Distribution-Matching RL to Large Language Models
摘要
生成流网络 (GFlowNets) 为大型推理模型的奖励最大化强化学习 (RL) 提供了一种有前途的替代方案,通过匹配奖励分布而不是崩溃到主导模式来鼓励多样化的推理路径。最近的工作在数学和代码方面显示出了希望,但将 GFlowNet 式的 RL 扩展到现代 后训练 管道仍然很困难:随着模型大小、采样轨迹长度、奖励噪声和分布式系统复杂性一起增长,学习的提示条件划分函数成为梯度不稳定和工程开销的根源,而不是有用的标准化器。通过系统分析,我们发现之前被视为必需的学习配分函数可以用根据训练所需的 rollout 组计算出的批内蒙特卡罗估计来代替。我们提出了 GFlowRL,一种简化的 GFlowNet 式 RL 算法,它完全删除辅助分区网络,同时保留奖励分布匹配目标,由两个稳定器完成:针对 rollout/trainer 漂移的重要性采样校正和针对离群残差的非对称流间隙裁剪。 GFlowRL 在数学、代码和对抗性红队基准测试方面超过了所有同行,在 14B 规模下达到了 2048 的 Codeforces 评级(o3-mini 的 25 Elo 以内),并在 AdvBench 和 HarmBench 上获得了最高的平均 ASR@1,在 FlowRL(之前的 GFlowNet 风格方法)发散的情况下,优于之前的 SOTA 多轮攻击者。相同的配方传输到所有评估的 MoE 配置(最多 235B 参数),其中 FlowRL 再次无法收敛。据我们所知,GFlowRL 是第一个能够在密集和稀疏架构上稳定扩展的 GFlowNet 式强化学习算法。代码位于:https://github.com/microsoft/gflowrl