论文
CERO:协调RL后训练全程采样位置与预算
CERO: Where and When to Allocate Rollouts for RL Post-Training
摘要
与组相关的强化学习的自适应Rollout方法通常会跨提示分配固定的每次更新预算。相反,我们研究如何在整个培训范围内协调有限的推出预算。我们使用累积即时曝光的凹代理效用来制定这个问题,并引入 CERO,一个用于即时入场和预算节奏的在线原始双重调度程序。在我们的实验中,每个承认的提示都会收到一个固定大小的响应组。相反,CERO 会调整选择的提示、各轮中重新访问它们的频率以及每轮中生成的组数。紧凑的 Fenchel 表示线性化对累积暴露的依赖性,而预测的在线梯度下降则使用奖励变化反馈和预算偏差更新提示特定的支持斜率和共享预算价格。我们根据固定利率和同路径时变基准为替代分配目标建立路径保证,并为替代差异和利率变化提供明确的条款。在匹配的训练响应下 在预算方面,CERO 在五个数学推理基准的三个骨干网中均获得了最高的 avg@16 宏观平均值。机制分析将 CERO 的及时选择与组内奖励对比联系起来,而多种子消融显示了统一和预设支出计划的自适应节奏带来的收益。
