论文

您只需要简单的样本:通过数据高效的强化学习自我进化 LLM

Easy Samples Are All You Need: Self-Evolving LLMs via Data-Efficient Reinforcement Learning

模型训练强化学习

摘要

之前基于 LLM 的 RL 研究通常遵循高注释成本的监督学习,或者使用投票或基于熵的奖励的无监督范式。然而,由于大量的注释成本和模型崩溃或 奖励作弊 等问题,它们的性能仍然远不能令人满意。为了解决这些问题,我们引入了受认知学习理论启发的新视角,并提出了一种名为 EasyRL 的新方法。 EasyRL 的核心是通过将来自简单标记数据的可靠知识转移与处理日益困难的未标记数据的渐进分而治之策略相结合来模拟人类认知获取曲线。具体来说,我们使用带有少量标签数据的监督强化学习来初始化一个预热模型。接下来是对困难的未标记数据的分而治之的伪标记策略,结合针对低不确定性情况的基于一致性的选择和针对中等不确定性情况的基于反射的解决方案。最后,通过迭代伪标签和强化学习进行难度渐进式自我训练,进一步增强了模型的推理能力。 EasyRL 提供了一个统一的自我进化框架,有助于 LLM 的数据高效 后训练。数学和科学基准的实验结果表明,EasyRL 仅使用 10% 的简单标记数据,始终优于最先进的基准。