论文
RFPO:用预训练Critic提供策略优化信号
Unlocking the Critic: Reward-Free Policy Optimization for LLM Post-Training
摘要
近期大语言模型的强化学习后训练常移除Critic(价值评估模型),以减少训练不稳定性和内存开销;即使训练了Critic,也往往在训练结束后弃用,尽管它已经学会预测结果。本文重新检验这一做法,发现预训练Critic的结果预测能力可用于高效的长程推理。首先,长思维链训练中的不稳定性在很大程度上来自优化方式:采用幅度较小、方差较低的策略更新,可以恢复稳定收敛。其次,充分预训练的Critic能从轨迹后期状态和未完成前缀估计最终成功的后验概率。这些预测可提供源于任务结果的密集前缀训练信号,策略优化时不必等待轨迹完成,也不需要逐步标注或外部奖励标签。基于这一发现,RFPO复用一个已校准、冻结的Critic,同时提供轨迹级奖励、广义优势估计的价值基线,以及未完成前缀的成功预测。将去偏后的分数二值化,还可防止策略利用Critic对长度的偏差。二值化后的RFPO在训练循环中无需任何标签,即可达到有监督PPO的表现,同时降低计算和内存开销。它适合结果较晚出现、生成成本较高的长程推理任务,因为未完成轨迹也能得到奖励,不再必须等待每条轨迹结束。研究据此提出,基于Critic、无需外部奖励标签的优化可作为大语言模型后训练的一条可扩展、高效路径。