fg-expo:通过自适应 kl 和高斯课程进行前沿引导探索优先的政策优化
fg-expo: Frontier-guided exploration-prioritized policy optimization via adaptive kl and gaussian curriculum
摘要
可验证奖励的强化学习 (RLVR) 已成为 LLM 数学推理的标准范式,其中组相对策略优化 (GRPO) 成为主导算法。我们发现了 GRPO 固有的两个被忽视的低效率问题。首先,当模型需要显着偏离参考政策时,固定的 KL 系数过度限制了政策探索。其次,统一的问题抽样忽略了中等难度的问题会产生信息最丰富的梯度信号。我们提出了 FG-ExPO,是 Frontier-Guided Exploration-Prioritized Policy Optimization 的缩写,它集成了两个轻量级组件。精度条件 KL 缩放(AKL)通过批次平均精度的平滑非线性函数调整 KL 惩罚强度,在模型表现不佳时放松约束,在模型取得满意结果时加强约束。高斯课程抽样 (GCS) 将抽样权重分配给遵循以 0.5 左右的中等准确度水平为中心的高斯分布的问题,将 模型训练 集中在其学习前沿。我们在六个主流数学推理基准测试中对 DeepSeek-R1-Distill-Qwen-1.5B 和 Qwen3-8B-Base 进行了评估。实验结果表明,FG-ExPO 的性能始终优于普通 GRPO。与 AIME 2025 pass@32 指标相比,它的绝对提升了 13.34,从 63.33% 上升到 76.67%,并且在 8B 模型上获得了 2.66 的平均 pass@32 增益。与 pass@1 相比,在 pass@32 上观察到的性能提升要大得多,这证明 FG-ExPO 在固定推理预算下扩大了模型的有效探索空间。