论文
体验 LLM 推理的增强策略优化
Experience Augmented Policy Optimization for LLM Reasoning
摘要
带可验证奖励的强化学习(RLVR)是提高 大语言模型(LLM)推理能力的强大范例。然而,现有的RLVR方法通常依赖于从头开始的同策略优化,导致采样成本较高且积累的经验利用效率低下。随着模型能力和策略行为在训练过程中不断发展,最近通过固定推理轨迹重用经验的尝试进一步遭受策略不匹配的困扰。受这些限制的启发,我们认为 RLVR 中的经验不应该被重用为固定的推理轨迹,而应该以策略自适应的方式表达。在这项工作中,我们提出了体验增强策略优化(EAPO),它利用先前的强化学习优化策略作为行动级经验,并在轨迹采样期间有选择地在关键决策点注入经验。为了确保从经验增强的执行轨迹中获得稳定和公正的学习,EAPO 进一步纳入了适应性重要性抽样方案。在五个不同基准上使用 Qwen-2.5-math 7b 和 Qwen-3-8B 的实验表明,与最先进的 RLVR 方法相比,EAPO 持续提高了推理性能。