论文
SAF-OPD:同策略 蒸馏 的稳定优势融合
SAF-OPD: Stable Advantage Fusion for On-Policy Distillation
摘要
具有可验证奖励的强化学习 (RLVR) 向每个词元广播单个响应级别奖励,而 同策略 蒸馏 (OPD) 对每个词元进行评分,以对抗更强大的教师以获得密集优势,但会限制教师质量的表现并阻止超越它的探索。它们的互补性使得 RLVR 和 OPD 的结合充满希望,但我们发现,将这两个优势与固定系数融合会触发来自两种错误校准的熵崩溃:幅度不匹配,其中 词元级 OPD 优势可以远远超过有界的 RLVR 优势并消除其信号;以及时间不匹配,其中持续的全强度 OPD 不断将学生拉向教师,并限制超越它所需的探索。我们提出了 SAF,一种稳定优势融合框架,它通过仅应用于 OPD 优势的轻量级四级管道解决这两个问题:用于幅度控制的稀疏然后压缩机制与用于时间控制的预热然后退火机制配对,每个阶段都可以独立切换,并且增加的开销可以忽略不计。使用 GRPO 实例化 RLVR,我们使用 Qwen3-1.7B/4B/8B 在七个数学推理和代码生成基准上评估 SAF:SAF 避免了熵崩溃,并始终优于固定系数 GRPO+OPD 融合,将所有六个模型域设置的总分提高了 0.51-2.70%,同时实现了更稳定的训练。