论文
最大化 GRPO 信号:针对硬推理问题的自适应跟踪前缀控制
Max Out GRPO Signal: Adaptive Trace Prefix Control for Hard Reasoning Problems
摘要
组相对策略优化(GRPO)在模型最难的问题上停滞不前:当组中没有成功执行轨迹时,组相对优势消失,问题不贡献梯度,浪费了我们最想学习的前沿示例。在参考解决方案前面添加正确的前缀可以提高成功率,使前缀长度成为难度的连续旋钮。并发方法设置旋钮一次; AdaPrefix-GRPO 将其变成反馈控制器:在整个训练过程中,它会调整每个问题获得的解决方案的数量,将其成功率保持在 50% 附近,其中 GRPO 的梯度信号最大,然后完全撤回辅助,因此部署的模型可以独立解决问题。在硬数学上,在匹配的训练 FLOP 下,GRPO 对 0.6B 模型训练分布中的保留问题的准确率提高了一倍以上(2.1 倍),其中 Qwen3-1.7B 为 1.6 倍,AIME 为 1.7 倍,同时轨迹长度大致减半。该方法是在数据准备加上前缀标记上的丢失掩码中实现的;教练机另有库存。模型越小,增益越大。