论文
MCPO:面向大推理模型的掌握巩固策略优化
MCPO: Mastery-Consolidated Policy Optimization for Large Reasoning Models
摘要
可验证奖励强化学习(RLVR)已成为提升大语言模型(LLM)推理能力的一种有前景的方法。在RLVR算法中,组相对策略优化(GRPO)及其变体展现了强劲性能和高训练效率。然而,GRPO类目标在高准确率提示上暴露两个问题,包括已掌握提示(rollout准确率=1)和多数正确提示(rollout准确率在(0.5,1))。对已掌握提示,组相对优势消失,不产生训练信号,且策略漂移不受约束,可能导致遗忘。对多数正确提示,诱导的查询权重随准确率上升而缩小,削弱了从部分正确到完全掌握的巩固。为缓解这些问题,我们提出掌握巩固策略优化(MCPO),引入(i)仅作用于已掌握提示的hinge-KL正则项,以约束相邻梯度步之间的有害策略漂移;(ii)优先多数正确提示的加权机制,以更好地分配优化精力。在三个数学基准上的大量实验表明,MCPO持续提升pass@1性能。出人意料的是,MCPO并未限制探索,反而提升了pass@k指标,表明掌握巩固会进一步催化解的多样性。
