论文

简单、困难、易学:LLM 推理的置信度和难度自适应策略优化

The Easy, the Hard, and the Learnable: Confidence and Difficulty-Adaptive Policy Optimization for LLM Reasoning

模型训练强化学习

摘要

具有可验证奖励的强化学习可以显着改善 LLM 推理,但标准 GRPO 式训练通常通过统一采样和加权来处理简单、困难和可学习的问题,从而导致计算分配效率低下。我们通过跟踪标记对数概率、组标准化优势和诱导的 词元级 更新权重来研究 GRPO。这揭示了随着训练的进行而出现的三种反复出现的动态:(1) 信心膨胀,(2) 优势收缩,以及 (3) 层次收敛。这些发现表明,每次更新的效用在很大程度上取决于问题难度和模型当前的能力。受此启发,我们提出了置信度和难度自适应策略优化(CoDaPO),它根据执行轨迹置信度和经验难度为每个问题分配一个有界值。然后,CoDaPO 使用该值重新加权策略更新并在小批量内重新采样高价值的可学习问题,从而在固定计算预算下增加可学习范围内的发现。在 12 个基准测试中,CoDaPO 持续提高了现有 RL 方法的准确性。我们的代码可在 https://github.com/tmlr-group/CoDaPO 上公开获取。