论文

在哪里进行部署:基于组的 RLVR 的热门实用程序最佳部署分配

Where to Spend Rollouts: Hit-Utility Optimal Rollout Allocation for Group-Based RLVR

模型训练强化学习

摘要

具有可验证奖励的强化学习(RLVR)已成为提高 大语言模型 推理能力的核心范例。基于组的策略优化方法(例如 GRPO)通常为每个提示分配固定数量的采样轨迹。这种统一分配可能效率低下:它将计算过度分配给采样组已经饱和的提示,而对额外样本可能揭示有用的正确轨迹的提示探索不足。为了解决这一限制,我们引入了命中效用,即提示的建议附加分配中至少一次采样轨迹是正确的后验概率。基于这个概念,我们提出了命中效用最佳转出分配(HORA),这是一种无需学习的转出分配策略,可最大化每个分配批次内的总后验命中效用。 HORA 自适应地重新分配采样轨迹预算,同时保持下游奖励评估和​​基于组的优势估计器不变。在四个数学推理基准和三个模型尺度上,HORA 在 12 个模型基准配置中的 10 个中保留了可比较的 Pass@1,并改进了与计算匹配的 GRPO 相比的 Pass@K,其中有一个平局和一个饱和例外。它还与其他基于组的估计器(例如 RLOO)直接兼容。消融研究表明,HORA 使用的统一先验与五种即时条件学习先验替代方案具有竞争力。