论文

sGPO:用推理 FLOP 来提高 RLVR 中的训练效率

sGPO: Trading Inference FLOPs for Training Efficiency in RLVR

模型训练强化学习

摘要

标准强化学习与可验证奖励 (RLVR) 训练为每个查询分配固定的轨迹采样预算,而不考虑每个查询的难度对当前策略意味着什么。这导致两种对称的故障模式:简单的查询产生几乎为零的优势,因为策略已经解决了它们,而无法解决的查询不会产生信号,因为策略永远不会解决它们。这两种机制都浪费了训练失败次数,而没有对学习梯度做出贡献。我们引入排序组策略优化 (sGPO),这是一种计算高效的策略,可以用少量的推理 FLOP 预算来大量减少浪费的训练 FLOP。关键的见解是廉价的推理计算可以作为查询难度的单个离线代理。通过在初始策略下为每个查询生成一小批并行样本,我们获得了模型感知的经验成功率。这促使将训练 rollout 组大小设置为该成功率的倒数,这是一种通过在每个生成的 rollout 中提取最大优势来最大化样本效率的实用规则。这个单一的分析过程同时驱动数据过滤(删除琐碎的查询和子采样无法解决的查询)、自适应组大小分配和课程构建(从易到难的安排查询)。 sGPO 匹配或超过基准性能,同时将总训练计算量减少三倍,其中包括前期推理分析成本。