论文
更相信批评家
Trust the Critic More
摘要
标准语言模型强化学习算法将长期部署的每个词元都赋予由终端奖励决定的相同优势。Actor-Critic方法可以提供更细粒度的信用分配,但在使用强化学习训练大语言模型时,学习批评家通常被认为太不准确,无法信任。在最近的作品中,即使存在批评者,它也仅用于基线估计,因此每条轨迹都必须rollout到其最终奖励。我们引入了带有 Action Chunking (AC2) 的 Actor-Critic,它消除了滚动每个轨迹以完成的需要。相反,AC2 将功劳分配给动作块:过去轨迹前缀的简短延续。博学的批评家会对每个动作块结束时达到的状态进行评分,从而允许策略在不观察最终奖励的情况下进行更新。我们通过三种设计选择使基于评论家的学分分配变得可靠。首先,我们引入本地准备,仅当批评者对特定问题足够准确时才使用基于批评者的问题更新。其次,如果可用,我们会向评论家提供之前成功rollout的参考解决方案。第三,我们将信用分配给 10k 个词元的动作块而不是单个词元,从而为评论家提供了更有意义的轨迹部分来评估。我们使用 AC2 在 FineProofs-RL 上训练 Qwen3-4B,并在 IMO-ProofBench 上进行评估。 AC2 的解码 FLOP 数减少了 2.5 倍,超过了 GRPO 18.5% 的峰值验证分数。这种增益来自两个来源,(1) AC2 需要减少 25% 的训练步骤才能达到此分数,(2) 每个步骤生成的词元更少,因为策略不需要继续每个轨迹直至完成。从概念上讲,我们证明了我们可以消除将每条轨迹rollout到完成的需要,为 LLM RL 算法开辟了一个先前未探索的巨大设计空间。