论文
群体相关策略优化中的优势崩溃:诊断与缓解
Advantage Collapse in Group Relative Policy Optimization: Diagnosis and Mitigation
摘要
组相对策略优化(GRPO)是可验证奖励强化学习(RLVR)框架内的一种重要算法,在提高 大语言模型(LLM)的推理能力方面取得了显着的成果。然而,GRPO 很容易出现优势崩溃,这是一种失败模式,其中组内的同质奖励(例如,所有正确或所有错误的答案)产生接近于零的优势和消失的梯度。为了解决这个问题,我们引入了优势崩溃率(ACR),这是第一个量化无效梯度训练批次比例的诊断指标。在数学推理基准上从 0.5B 到 14B 参数的模型中,我们表明 ACR 强烈预测训练停滞和最终性能。然后,我们提出自适应虚拟样本策略优化(AVSPO),这是 GRPO 的轻量级扩展,它在实时 ACR 监控的指导下注入虚拟奖励样本,从而无需额外采样轨迹模型即可从同类群体中进行学习。相对于 GRPO,AVSPO 减少了 58-63% 的优势崩溃,并在所有模型规模上产生了 4-6 个百分点的一致精度增益,同时保持了评估的域外任务的泛化性。代码和数据集可在 https://github.com/hexifang/Advantage-Collapse-Rate 获取。