论文
从差距中学习:通过 GRPO 的自适应rollout采样进行差异感知优势修剪
Learn from the Gap: Differential-Aware Advantage Pruning with Adaptive Rollout Sampling for GRPO
摘要
最近,组相对策略优化(GRPO)及其变体已被开发用于策略优化,并表现出显着的性能提升。然而,由于每个问题的多次rollout采样和跨rollout重复的每个词元概率评估,这些方法通常会产生大量的计算开销。此外,低信息或高度同质的轨迹会降低下游学习信号效率,阻碍模型优化并限制最终性能。为了解决这些问题,我们提出了 FastRL,这是一种新颖的即插即用强化学习框架,可以同时提高训练效率和策略学习的有效性。具体来说,1)我们引入了一种优势感知剪枝策略,以选择性地保留高优势轨迹,同时最大化轨迹间梯度多样性。 2)然后,我们设计了一种自适应rollout采样机制,根据历史剪枝分布动态调整不同训练阶段的采样规模,平衡探索充分性和计算效率。实验表明,FastRL 可以无缝集成到 GRPO、DAPO 和 GSPO 变体中,在 Geometry3K 和 GeoQA8K-R1V 上实现平均 2.07$\times$ 的训练加速,同时视觉推理基准的平均准确度提高约 1.64\%。源代码可在 https://github.com/Nicozwy/FastRL. 获取