论文

VeriGate:GRPO 的验证者门控步骤级监督

VeriGate: Verifier-Gated Step-Level Supervision for GRPO

模型训练奖励建模与过程监督

摘要

组相对策略优化(GRPO)是训练具有基于验证者的结果奖励的推理模型的有效方法,但其监督稀疏:当提示的所有采样轨迹都收到相同的验证者奖励时,组相对优势崩溃为零并且学习停滞。仅结果奖励也不提供阶梯级别的贡献分配,限制了探索并使学习稳健的推理变得更加困难。我们推出了 VeriGate(验证者门控步进级 GRPO),这是 GRPO 的验证者门控扩展,它通过三种设计选择解决了这些限制。首先,每当验证者奖励在采样轨迹中引起有意义的偏好时,VeriGate 都会让验证者负责,并且仅当验证者奖励退化时才使用过程监督。其次,VeriGate 没有将过程奖励模型 (PRM) 步骤分数分解为单个轨迹奖励,而是将其转换为未来累积的奖励,以分配连续感知信用。第三,VeriGate 将这些奖励转化为群体归一化的 词元级 优势,恢复信息梯度和细粒度的贡献分配,同时比优化聚合 PRM 分数的方法更不易受 奖励作弊 的影响。根据经验,使用 1.5B 和 7B Qwen2.5-Instruct 模型进行 MATH 训练并对六个推理基准进行评估,VeriGate 将 1.5B 和 7B 模型的平均准确度分别提高了约 20% 和 12%,大幅减少了零梯度失败,减少了 奖励作弊 行为,并相对于仅结果 GRPO 和 PRM 作为结果基线提高了推理质量。