论文
以正确的节奏学习:自适应数据调度改进 LLM 强化学习
Learning at the Right Pace: Adaptive Data Scheduling Improves LLM Reinforcement Learning
摘要
大语言模型(LLM)通过强化学习(RL)后训练实现卓越的推理能力。然而,现有的RL 后训练通常依赖于统一的数据采样,忽略了训练数据的语义结构和训练策略的变化能力。为了解决这些限制,我们提出了自适应数据调度(ADS),这是一种用于调节 RL 后训练 的双层数据调度框架,它用语义集群上的自适应分布和策略边界样本选择来取代均匀采样。在集群级别,ADS 根据语义模式组织样本,并维护自适应集群间分布以巩固当前的训练进度。在样本层面,ADS执行集群内调度来连续采样策略边界样本,这提供了信息丰富的相对优势。三个 LLM 和七个推理基准的实验结果表明,ADS 比组相对策略优化 (GRPO) 的平均准确度提高了 5.2%。值得注意的是,ADS 不断改进具有不同目标设计的 RL 方法,突出了其作为 LLM RL 后训练 通用数据调度策略的潜力。源代码位于:https://github.com/Richard-zrx/ADS。