论文
通过解耦优势标准化稳定评分标准集成训练
Stabilizing Rubric Integration Training via Decoupled Advantage Normalization
摘要
我们提出过程感知策略优化(PAPO),通过解耦优势归一化把过程级评估整合进组相对策略优化(GRPO),以解决现有奖励设计的两个局限。结果奖励模型(ORM)只评估最终答案的正确性,对所有正确回复一视同仁而不计推理质量,且当组内回复趋于全部正确时优势信号逐渐消失。过程奖励模型(PRM)提供更丰富的监督,但直接使用PRM分数会引发奖励破解:模型靠冗长叙述抬高分数,而准确率崩塌。PAPO通过组合优势同时解决两者:一部分是源自ORM并在全部回复上归一化的结果分量Aout,另一部分是源自基于量规的PRM并仅在正确回复之间归一化的过程分量Aproc。这一解耦设计确保Aout将训练锚定在正确性上,同时Aproc在不扭曲结果信号的前提下区分推理质量。跨多个模型规模与六个基准的实验表明,PAPO持续优于ORM,在OlympiadBench上达到51.3%对46.3%,并且在ORM进入平台期并下滑时仍继续提升。