论文
REGEN:通过离线强化学习实现从专家到通才 蒸馏 的重放循环
REGEN: Replay-recycling for Expert-to-Generalist distillation with Offline Reinforcement Learning
摘要
大规模在线强化学习(RL)是 大语言模型(LLM)中获得高级能力的主要手段,包括长期推理和代理工具使用。然而,继续将其扩展到广泛的感兴趣的任务领域在计算基础设施和成本方面仍然具有挑战性,特别是当将强化学习视为仅仅是一次性学习阶段时。最近,一种广泛使用的跨领域和训练阶段的知识提炼技术,即多教师 同策略 蒸馏 (MOPD),有助于解耦 RL 阶段,节省成本,同时保持跨广阔领域的通用性。尽管如此,与在线强化学习类似,MOPD 需要耦合推理和后向传递,这继续限制了其可扩展性和计算效率。为了应对这些挑战,我们提出了 REGEN:通过离线 RL 进行从专家到通才的重放回收 蒸馏。 REGEN 不是从多个教师模型中提炼出来,而是通过简单地回收重放内存(教师专业 RL 训练的免费副产品)并采用离线 RL 算法来训练多面手。 REGEN将rollout采样与后向训练过程完全解耦,从而大大降低了训练成本。在数学推理、代码生成和指令跟踪方面,REGEN 以低得多的成本与 MOPD 的准确性相匹配。它有可能将在线强化学习转变为数据合成过程,而不是一次性学习阶段,并且可以扩展到大规模 后训练,而不需要大量的计算负载。代码可在 https://github.com/yunjie-sysu/REGEN 获取。