开源项目
PACT:开放Actor-Then-Critic训练实现
AllSpark-Research/PACT
概述
PACT 是PPO训练的配套方法实现,供强化学习研究者复现有界价值估计与更新顺序调整。 代码以BCE替代Value的均方误差回归,并先更新Actor,再按新旧策略概率修正Critic训练;复用旧轨迹,只增加更新后Actor的一次前向计算,局部重要性比率屏蔽范围外样本。 方法适用性取决于任务、奖励与PPO配置。代码开放不证明所有强化学习场景均有收益,复现应按论文对照检查更新顺序和采样范围。