论文

CAST:面向GRPO的非特权截断非对称自教学与优势翻转

CAST: Non-Privileged Clipped Asymmetric Self-Teaching with Advantage Flipping for GRPO

模型训练强化学习RLVR

摘要

带可验证奖励的强化学习(RLVR),尤其是组相对策略优化(GRPO),已被广泛用于提升大语言模型的推理能力。然而,结果层级的奖励只能提供稀疏监督,且当某个提示的所有采样轨迹全对或全错时,组相对优势会消失。在线自蒸馏(OPSD)提供了密集的token级指导,但其token偏好未必与轨迹正确性对齐;实证诊断显示,OPSD信号在正确与错误rollout上的表现不同,教师为正与教师为负的差距信号呈现不同的噪声特征。这些诊断仅在OPSD式特权教师情境下进行、仅用于分析,而CAST训练使用无答案的自教师打分。受这些观察启发,本工作提出CAST,一种面向GRPO式RLVR的无答案自蒸馏方法。CAST保留了以验证器为基础的GRPO目标,但使用停止梯度的自教师依据轨迹正确性来塑形token级优势。与以往自蒸馏式RLVR方法不同,CAST无需以参考解为条件的教师打分,在整个训练过程中保持自教师对数概率差距信号活跃,并施加双向局部优势符号翻转:正确轨迹中教师为负的token可以获得负的token级优势,而错误轨迹中教师为正的token可以获得有界的正局部优势。对于零方差的全对与全错组,CAST分配有界的、受符号约束的基础优势,使这些原本零梯度的组也能贡献带验证器符号的token反馈。数学推理实验表明,CAST改进了RLVR训练,同时保持了轻量的、以验证器为基础的轨迹级目标。

CAST:面向GRPO的非特权截断非对称自教学与优势翻转:论文配图
图1:GRPO与本文提出的CAST方法的整体概览,展示CAST相对GRPO的改进框架。