论文
最佳实践批评者优化
Best Practice Critic Optimization
摘要
基于组的强化学习方法(例如 大语言模型 的 GRPO)避免通过对每个提示采样多个响应来训练批评者。可靠的批评家可以从一个响应中估计 词元级 的优势,但基于标准批评家的训练方法通常不稳定。我们研究这种不稳定性并开发**最佳实践批评优化(BPCO)**,这是一种结合了 DPPO、受限于奖励范围的价值预测、蒙特卡洛价值目标、非标准化策略优势和长度自适应广义优势估计的方法。由于批评家仅在训练期间使用,因此 BPCO 还可以根据奖励定义信息(例如参考答案或评分标准)对其进行调节,这些信息隐藏在策略中。对照实验隔离了每个设计选择的影响。在模型范围从 1.5B 参数到 30B-A3B 专家混合的数学推理任务中,BPCO 始终如一地改进基于强大批评家的基线,并匹配或超过基于组的基线,同时对每个提示采样一个响应。同样的方法还可以通过基于规则的奖励来改善学习。这些结果表明,精心设计的批评家为群体相对优势估计提供了可靠的替代方案。代码可在 https://github.com/QPHutu/golden_critic 获取。