论文

Learning-Zone Energy:高效强化学习的在线数据选择 后训练

Learning-Zone Energy: Online Data Selection for Efficient RL Post-Training

模型训练合成数据

摘要

强化学习 (RL) 后训练 已成为 大语言模型 (LLM) 中引出数学推理的主导范例,但 GRPO 和 DAPO 等流行技术在提示中几乎均匀地分配采样轨迹和梯度预算,浪费了对已经掌握或远远超出模型当前能力的样本的计算。为了解决这种根本性的低效率问题,我们提出了 Learning-Zone Energy (LZE),这是一个有理论依据的、完全在线的数据选择框架,它将计算集中在模型的主动学习前沿。其核心是,我们定义了一个封闭形式的学习区能量分数,它将三个互补信号、一个初始难度锚、一个标准化结果不确定性项和一个通过率动量融合成一个标量,该标量可证明与群体相关政策梯度更新的预期幅度一致。具有重播功能的前向剪枝器通过跳过滚动生成以获取持久解决的提示,同时定期检查遗忘情况,从而进一步减少挂钟时间成本。在跨 GSM8K、MATH 和 DAPO-MATH 的 Qwen 系列模型 (1.5B-8B) 上进行评估,我们的方法每步仅保留 40% 的训练数据,但仍匹配或超过完整数据基线,其中 AIME25 (+45.9%) 和 AMC23 (+18.2%) 的分布外增益尤其明显,同时训练失败次数预计减少 36%。我们的代码可在 https://github.com/Stellaris167/LZE 获取。