论文

Pilot-Commit:将强化学习后训练的采样预算分配给有效提示

Spend Your Rollouts Where It Counts: Rollout Allocation for Group-Based RL Post-Training

模型训练强化学习

摘要

强化学习 (RL) 是 后训练 大语言模型 的主导范例。然而,在在线 同策略 设置中,rollout 生成在训练的计算成本中占主导地位。基于组的策略优化方法计算每个提示的多次轨迹采样的优势,但它们不加区别地将预算分配给奖励分布崩溃的提示,将昂贵的轨迹采样浪费在可以忽略不计的学习信号上。我们证明基于组的更新在高奖励方差的制度中最有效。由于策略在整个训练过程中不断发展,因此必须在线估计提示信息而不是预先计算,但详尽评估每个提示在计算上是令人望而却步的。我们引入 Pilot-Commit,这是一种针对基于组的 RL 后训练 的预算意识轨迹采样分配框架。 Pilot-Commit 将提示评估与利用脱钩:试点阶段使用预算的一小部分来估计每个提示的信息量,剩余的轨迹采样将分配给高杠杆提示,而跳过低信号提示。在多个数学推理基准和从 1.5B 到 14B 参数的模型规模中,Pilot-Commit 将基线精度与显着降低的采样成本相匹配,在累计轨迹采样中达到目标精度比 GRPO 最高快 1.9 倍,比 DAPO 最高快 4.0 倍。