论文

当教师指导产生误导:奖励对齐的同策略蒸馏

When Teacher Guidance Misleads: Reward-Aligned On-Policy Distillation

摘要

在策略蒸馏 (OPD) 最近已成为大语言模型 (LLM) 的流行后训练范例,提供了一种将教师模型的知识和能力转移到学生模型中的有效方法。然而,教师对学生生成的前缀的指导并不总是可靠的。训练应该优化模型,以生成更有可能正确的响应,或者同等地,获得更高的结果奖励。但在 OPD 期间,教师模型可能会提供指导,阻止学生走向正确的轨迹,或者使学生走向不正确的轨迹,这与结果奖励不一致。这种不一致的指导是不可靠的,因为它会误导优化过程并最终降低模型性能。为了减轻教师指导不一致的情况,我们提出了奖励调整的政策蒸馏(RA-OPD)。关键的见解是仅保留其诱导更新使学生走向正确轨迹或阻止学生走向错误轨迹的轨迹。具体来说,对于每个采样轨迹,RA-OPD 检查其轨迹级蒸馏回报是否与其结果奖励一致,然后过滤掉未对齐的轨迹。 RA-OPD 选择更可靠的轨迹来提高学生模型性能,而不需要额外的计算成本。我们使用 Qwen3 系列和 DeepSeek-R1 系列的模型在数学和代码基准上评估 RA-OPD。在七个数学基准测试和三个代码基准测试中,RA-OPD 的性能显着优于标准 OPD 和其他经过测试的 OPD 变体。