论文

缓冲区很重要:释放离策略强化学习在大语言模型推理中的威力

Buffer Matters: Unleashing the Power of Off-Policy Reinforcement Learning in Large Language Model Reasoning

模型训练强化学习RLVR

摘要

传统的在线策略可验证奖励强化学习(RLVR)框架存在经验浪费与奖励同质化问题,直接阻碍了大语言模型后训练中对困难样本的学习效率。本文提出 Batch Adaptation Policy Optimization(BAPO),一个离策略 RLVR 框架,用于提升大语言模型后训练的数据效率。它通过重新评估历史上困难的样本并复用高质量样本来动态选择训练批次,同时为策略改进保持下界保证。大量实验进一步表明,BAPO 在数学、规划与视觉推理任务上较 GRPO 平均提升 12.5%。关键的是,BAPO 成功解决了 40.7% 基座模型始终无法解决的问题。

缓冲区很重要:释放离策略强化学习在大语言模型推理中的威力
图3:我们 RLVR 框架中 (a) 离策略 rollout 与 (b) 离策略训练的工作流程