论文
我们可以相信老师吗?自蒸馏的解耦信用方向-幅度
Can We Trust the Teacher? Decoupled Credit Direction-Magnitude for Self-Distillation
摘要
RLVR 提供可靠的轨迹级信用,而 OPSD 则提供词元级信用的密集监管。正如我们的理论分析所支持的,这暴露了在更新阶段级学分方向和幅度与教师监督时的根本耦合,阻止了阶段接收可靠的学分方向和贡献幅度,同时使两者都容易受到教师判断错误和偏好方差的影响。为了将信用方向与其贡献大小分开,我们引入了 解耦信用自蒸馏(DCSD),它从理论上将信用方向和大小解耦为两个可靠的信号,并使用它们来校准特权教师监督。具体来说,我们设计了信念边际探测来确定信用方向和边际信息增益来量化信用程度,从而实现逐步到词元的信用分配以实现策略优化。在 11 项基准测试中,DCSD 相对于 GRPO、OPSD、RLSD 和 RLCSD 取得了最佳总体得分。与基础模型相比,DCSD 在数学推理上提高了 8.45 分,在多模态推理上提高了 7.01 分,同时纠正了 6\% 词元的信用方向,使词元信用程度降低了 1.5$\times$。