论文

大语言模型学习如何解决强化学习中的难题,永不放弃

Learning to Solve Hard Problems in RL for LLMs by Never Giving Up

模型训练强化学习

摘要

我们证明,使用强化学习训练大语言模型并不能平等地提高整个数据集的性能。强化学习对大语言模型已经擅长解决的简单问题显示出巨大的改进,但对困难问题的改进却很小。我们将这种现象称为大语言模型强化学习中的马太效应,这是经济学和网络科学将优势累积现象概括为“富者愈富”的现象。天真的解释是,难题需要更多的计算才能找到解决方案。我们认为,现代强化学习方法在简单的问题上浪费了太多的计算,从而加剧了这个问题,而应该动态地重新分配它们使用计算的方式。我们引入永不放弃(NGU),这是一种简单的自适应采样方法,可以不断为问题生成样本,直到正确为止。通过利用异步强化学习,这自然会使用更少的样本来过滤掉简单的问题,并分配更多的计算来解决更困难的问题。我们研究了影响 NGU 的设计选择,例如离策略鲁棒性,并开发了一套最佳实践。在数学基准 Deepscaler 上,NGU 提高了每次计算的性能,尤其是在更困难的问题上。在最近的一项编码任务 Manufactoria 中,带有每次测试奖励的标准 GRPO 无法完全解决具有一系列简单和困难测试的问题。 NGU 不断改进,解决越来越难的测试,直到学会完全解决编码问题。