论文

适应繁荣!用于改进 LLM 推理的自适应幂均值策略优化

Adapt to Thrive! Adaptive Power-Mean Policy Optimization for Improved LLM Reasoning

模型训练强化学习

摘要

带可验证奖励的强化学习(RLVR)是增强 大语言模型(LLM)推理能力的重要范例。然而,现有方法通常依赖于与模型不断发展的推理能力不一致的静态策略优化方案。为了解决这个问题,我们提出了自适应功率均值策略优化(AMPPO),它包括两个主要创新:功率均值策略优化(PMPO)和反馈自适应裁剪(FAC)。具体来说,PMPO 引入了广义功率均值目标。这使得模型能够自适应地从算术平均值的信号放大行为过渡到几何平均值的一致性强制行为。 FAC根据实时奖励统计数据自适应调整裁剪边界,以克服静态机制的局限性。利用这些创新,APMPO 提高了学习动态和推理性能。对三个推理任务的九个数据集进行的广泛实验展示了 APMPO 相对于最先进的基于 RLVR 的基线的优越性。例如,使用 Qwen2.5-3B-Instruct 时,与 GRPO 相比,APMPO 在数学推理基准测试中的平均 Pass@1 分数提高了 3.0 分。