论文

BASIS:LLM 推理的单次轨迹采样信息共享的批量优势估计

BASIS: Batchwise Advantage Estimation from Single-Rollout Information Sharing for LLM Reasoning

模型训练强化学习

摘要

具有可验证奖励的强化学习已成为提高 大语言模型 推理能力的标准方法。现有算法在价值估计和策略学习中面临计算效率和样本效率之间的权衡。我们引入了 BASIS,一种无批评的 后训练 算法,旨在解决这种权衡问题。在每个在线训练步骤中,BASIS 仅对每个提示进行一次轨迹采样采样,但利用整个批次中提示的丰富信息来改进价值函数估计。我们的实验表明,与具有代表性的单次轨迹采样基线 REINFORCE++ 相比,BASIS 将价值函数估计中的 MSE 降低了 69%,并且通过一次轨迹采样实现的 MSE 低于通过 8 次轨迹采样的组均值估计器。这种价值估计的改进转化为更好的策略优化:使用显着更少的训练时间,BASIS 实现的性能接近多轨迹采样 GRPO 类型基线,并且通常优于单轨迹采样 REINFORCE 类型基线。