论文

自我蒸馏零:自我修正将二元奖励变成密集监督

Self-Distillation Zero: Self-Revision Turns Binary Rewards into Dense Supervision

摘要

当前可验证设置中的 后训练 方法分为两类。强化学习(RLVR)依赖于二元奖励,它具有广泛的适用性和强大的功能,但在训练过程中仅提供稀疏的监督。 蒸馏 提供密集的 词元级 监督,通常从外部教师或使用高质量演示获得。收集此类监督可能成本高昂或无法实现。我们提出了 Self-蒸馏 Zero(SD-Zero),这种方法比 RL 的训练样本效率要高得多,并且不需要外部教师或高质量的演示。 SD-Zero 训练一个模型来扮演两个角色:生成器(生成初始响应)和修正器(根据该响应及其二元奖励来产生改进的响应)。然后,我们执行 同策略 self-蒸馏 将修订者提取到生成器中,使用以生成器的响应及其奖励为条件的修订者词元分布作为监督。实际上,SD-Zero 训练模型将二元奖励转化为密集的 词元级 自我监督。在 Qwen3-4B-Instruct 和 Olmo-3-7B-Instruct 的数学和代码推理基准上,SD-Zero 比基本模型提高了至少 10% 的性能,并且在相同的问题集和训练样本预算下优于强大的基线,包括 Rejection 微调 (RFT)、GRPO 和 Self-蒸馏 微调 (SDFT)。广泛的消融研究显示了我们提出的算法的两个新颖特征:(a)词元级自定位,其中修改者可以根据奖励识别生成器响应中需要修改的关键标记,以及(b)迭代自我进化,其中修改答案的能力的提高可以通过定期教师同步提炼回生成性能。代码:https://github.com/princeton-pli/Self-蒸馏-Zero。