论文

PACT 将Critic训练对齐更新后的策略

PACT: From Credit Assignment to Critic Alignment

模型训练模型评测强化学习奖励建模与过程监督模型能力评测RLVRAgentic RL

摘要

强化学习已成为大语言模型后训练的核心方法,但Token级信用缺乏公认数学定义,与常用训练信号的关系也不清楚。我们提出完备性、前缀一致性及中立性三项正则条件,证明它们唯一决定Token级信用。这一刻画统一解释现有算法的现象,并指导改进Actor–Critic训练。在这一视角下,同策略蒸馏(OPD)的理想教师相当于隐式Critic,其期望策略梯度与Token级信用产生的梯度成比例;回答级REINFORCE留一法(RLOO)虽粒度更粗,也具有相同的期望策略梯度贡献。我们进一步证明,在结果奖励有界时信用近似稀疏,广义优势估计(GAE)中间Critic误差可能达到与真实信用相当的幅度。由此提出策略对齐Critic训练PACT,采用先更新Actor、再更新Critic的顺序,对Critic训练进行重要性采样校正,使其更好对齐更新后的策略。在Agent数学推理的四个基准上,平均准确率72.87%,分别比GRPO和PPO高8.80、13.16个百分点;在SWE-bench Verified上,通过率67.4%,分别比PPO、GRPO和SAO高2.4、2.0、3.8个百分点。