论文

DRIFT:困难路由自我 蒸馏 与节奏门控探索和成功缓冲训练

DRIFT: Difficulty Routing Self-DIstillation with Rhythm-Gated Exploration and Success BuFfer Training

模型训练强化学习

摘要

使 大语言模型 在没有外部专家监督的情况下实现稳定的自我改进仍然是复杂推理任务中的核心挑战。现有的自我 蒸馏 和强化学习方法缺乏跟踪问题级学习进度并相应调整优化策略的明确机制。因此,训练可能会过度优化简单问题,对困难问题的监督较弱,并且无法充分探索边缘案例。为了解决这些问题,我们提出了 DRIFT,一种针对 大语言模型 的在线自进化策略优化框架。 DRIFT通过难度路由和节奏门控的联合使用来调节模型的自我改进过程。前者在问题层面识别模型的学习状态,并动态分配自蒸馏和强化学习信号,而后者在词元级处细化策略更新,集中探索关键推理位置。通过进一步结合成功缓冲区和两阶段课程学习策略,DRIFT 保留了高质量的历史经验,同时逐步引导模型从可靠的行为获取转向稳定的政策演化。经过五个基准和三个模型规模的评估,DRIFT 在所有评估指标上都超过了 GRPO 和 SDPO 的峰值性能。在五个基准测试的平均得分上,DRIFT 达到了 79.5$\%$,比 GRPO 高出 9.5$\%$,比 SDPO 高出 7.5$\%$,创造了新的最先进结果。值得注意的是,在 ToolUse 上,DRIFT 的准确率达到了 79.2$\%$,比 GRPO 提高了 13.5$\%$,比 SDPO 提高了 10.7$\%$,创下了新的最先进水平,并且大大优于所有并发方法。