论文

D$^2$Evo:双重难度感知自我进化,实现数据高效强化学习

D$^2$Evo: Dual Difficulty-Aware Self-Evolution for Data-Efficient Reinforcement Learning

模型训练强化学习

摘要

强化学习 (RL) 在 大语言模型 (LLM) 中展示了增强推理的潜力。然而,有效的强化学习训练需要中等难度的训练样本,面临着两个基本挑战:有效数据稀缺和动态难度转移,其中中等难度的样本稀缺,并且随着模型的改进而变得微不足道。现有方法通过生成训练样本在一定程度上缓解了这种稀缺性。然而,这些方法存在无锚生成、忽略共同进化和难度不匹配的问题。为了解决这些问题,我们提出了 D$^2$Evo,一种双重难度感知的自我进化 RL 框架。在每次迭代中,我们的方法根据当前求解器的能力挖掘中等难度的锚点,训练提问者以适当的难度级别生成不同的问题,并联合优化两个组件以实现渐进式推理增益。大量实验表明,D$^2$Evo 在少于 2K 真实数学样本的数学推理基准上优于现有方法,并且在通用推理基准上表现出很强的泛化能力。