论文

PAC:LLM多任务强化学习的进步增强优势课程

PAC: Progress-Augmented Advantage Curriculum for Multi-Task Reinforcement Learning of LLMs

模型训练强化学习

摘要

Reinforcement learning (RL) is used to improve the reasoning abilities of LLM, while training data span heterogeneous tasks.然而,大多数 RL 后训练 管道依赖于固定或手动设计的任务混合,即使任务的有用性随着训练的进展而变化。在线课程方法通常通过更新幅度来定义可学习性,而忽略更新是否转化为奖励收益,这可能会将轨迹采样预算错误地分配给具有大量但无效更新的任务。我们提出了 PAC,一种用于 LLM 多任务 RL 的进步增强优势课程,它结合了两个任务级信号:优势衍生的可学习性,它衡量任务可以引发的策略更新的程度,以及最近的奖励增益,它显示这些更新是否提高了任务性能。 A Bayesian Thompson Sampling controller uses these signals to allocate rollouts across tasks during GRPO training. We evaluate PAC under two settings: a multi-level reasoning setting and a multi-domain reasoning setting. PAC 提高了样本效率和最终性能:它以更少的轨迹采样步骤达到了可比较的验证分数,并且在两种设置中都比随机抽样和基于优势的课程基线实现了更高的最终平均值。这些结果表明,联合跟踪优势信号和实际奖励收益可以为 LLM 后训练 生成有效的在线课程。