论文
利用对照证据:以自特权 Critic 重构 RLVR 值估计
Privy to the Foil: Recasting Value Estimation with a Self-Privileged Critic for RLVR
摘要
在稀疏终端奖励下训练大语言模型完成多步推理时,给中间步骤分配信用仍是核心挑战。PPO 等 Actor-Critic 方法通过学习值函数构造词元级优势,但其效果取决于可靠的值估计。Critic 不仅要评估通往正确解答的进展,还要预判不断变化的策略未来会如何行动;任何一方面出错,都可能破坏信用分配并使在线训练不稳定。本文重新考察仅以状态为条件的标准值估计,提出自特权 Actor-Critic 框架 $π$PPO。它复用相同提示下经验证的 rollout 作为对照证据,帮助 Critic 根据成功和失败尝试评估中间推理,同时保留标准策略优化及部署接口。实验表明,$π$PPO 持续显著改善值估计质量,在困难数学推理基准上超过具有代表性的 Actor-Critic 及无需 Critic 的 RLVR 基线;即使搭配明显更小的非对称 Critic,也仍然有效。