论文

GRPODropout:在线强化学习推广少即是多

GRPODropout: Less is More for Online Reinforcement Learning Rollouts

模型训练强化学习

摘要

GRPO 等强化学习 (RL) 方法极大地改善了大型语言模型推理,但经常遭受策略熵崩溃:采样多样性的损失削弱了探索并限制了进一步的改进。现有方法可以通过算法级干预(例如奖励修改和熵/KL 正则化)或通过token级重新加权来解决此问题。我们研究了一个补充的观点:通过改变生成的推出对策略更新的贡献也可以减轻熵崩溃。在相同的抽样预算下,并非所有的推出都会对更新产生积极的贡献,有选择地排除一些可以改善学习。为了解决这个问题,我们提出GRPODropout:在标准更新之前,我们使用一个简单的策略,选择性地删除少量高概率的正优势部署,并将保留的优势重新集中。为了推动这一设计,我们开发了一个推广级理论分析来指导方法设计和阈值选择。该方法仅更改推出用法,并添加 计算开销可以忽略不计。实验表明,在使用更少的推出样本进行更新时,比原始 GRPO 具有更高的准确性和更高的参与者熵,这说明了“少即是多”。这项工作提供了对 RL rollout 使用情况的深入了解:删除一些 rollout 可以提高性能。代码可在 https://github.com/hexuandeng/GRPODropout/. 获取