论文

expo:通过自适应KL调节与高斯课程采样实现探索优先的策略优化

expo: Exploration-prioritized policy optimization via adaptive kl regulation and gaussian curriculum sampling

模型训练强化学习RLVR

摘要

可验证奖励强化学习(RLVR)已成为LLM数学推理的标准范式,其中群体相对策略优化(GRPO)是主流算法。我们指出GRPO中存在的两个研究不足的低效问题。其一,固定的KL惩罚系数在模型需要显著偏离参考策略的阶段过度限制了策略探索。其二,训练问题的均匀采样忽视了中等难度问题能为优化提供信息量最大的梯度信号。我们提出探索优先策略优化(EXPO),包含两个轻量级即插即用模块。精度条件KL缩放(AKL)通过批平均精度的平滑非线性函数动态调整KL正则化强度,在模型表现不佳时放松惩罚,在模型取得好成绩时加强惩罚。高斯课程采样(GCS)按照以0.5左右中等精度为中心的高斯分布为问题分配采样权重,将训练聚焦于模型的学习前沿。我们在DeepSeek-R1-Distill-Qwen-1.5B和Qwen3-8B-Base上、于六个数学推理基准上开展了大量实验。结果表明EXPO稳定超越原始GRPO。它在AIME 2025 pass@32上取得13.34的绝对增益,从63.33%升至76.67%,并在8B模型上取得平均2.66的pass@32提升。pass@32上远大于pass@1的性能增益表明,EXPO在固定推理成本预算下有效扩大了模型的探索边界。