论文

CanvasAnneal:扩散语言模型的课程强化学习

CanvasAnneal: Curriculum Reinforcement Learning for Diffusion Language Models

模型训练强化学习

摘要

扩散语言模型 (DLM) 提供了有前景的并行生成功能,但在复杂推理和工具使用任务中落后于自回归模型。虽然强化学习 (RL) 最近已被应用于增强 DLM,但标准 RL 方法却遇到了探索瓶颈。为了解决这个问题,我们从更强大的教师模型中注入推理先验来指导强化学习探索。在本文中,我们介绍了 CanvasAnneal,一个课程引导的扩散强化学习框架。在初始强化学习阶段,我们通过将教师生成的推理轨迹注入初始扩散画布来热启动探索。随着训练的进行,我们逐渐取消这种指导,并要求模型独立生成更多的推理轨迹。在数学推理和工具使用基准方面,CanvasAnneal 比 MATH500、Countdown 和 Tau2 上的标准 diffu-GRPO 有所改进,并显着加速了多项任务的奖励改进,而收益取决于任务。我们的结果表明,结构化训练时间指导可以缓解扩散强化学习中的探索瓶颈,并加快更困难任务的收敛速度。