论文
SEIF:用于指令跟随的自我进化强化学习
SEIF: Self-Evolving Reinforcement Learning for Instruction Following
摘要
指令跟随是 大语言模型 (LLM) 的基本能力,但持续改进该能力仍然具有挑战性。现有的方法通常依赖于来自人类或强大的教师模型的昂贵的外部监督,或者依赖于具有静态难度指令的自我对弈训练,而这些指令无法随着模型能力的提高而进化。为了解决这些限制,我们提出了SEIF(用于指令跟踪的自我进化强化学习),这是一种用于增强LLM的指令跟踪能力的自我进化框架。 SEIF形成了一个封闭的自我进化循环,提高了模型的指令跟踪能力,其中指令难度进化和模型能力进化相互促进。 SEIF 由四个角色组成:生成越来越具有挑战性的指令的指导者、删除冲突或无效指令以确保数据质量的过滤器、学习遵循进化指令的追随者以及为强化学习提供奖励信号的判断者。指导者和追随者在整个过程中交替接受训练和共同发展。跨多个模型规模和架构的实验表明,SEIF 持续提高指令跟踪性能,表明具有很强的通用性。进一步的分析揭示了改进的来源,并确定了开放式任务自我进化的有效训练策略:充分的早期训练以打下坚实的基础,随后进行适度的后期训练以减轻过度拟合并获得更好的最终表现。代码和数据可在 https://github.com/Rainier-rq1/SEIF 上公开获取。