论文
额外答案或解题信息为同策略自蒸馏增加了什么
What Does Privileged Information Add to On-Policy Self-Distillation?
摘要
按策略自蒸馏(OPSD)让语言模型可以从自身的冻结副本中学习,从而看到答案或可行的解决方案。向老师提供这些额外的信息似乎可以为学生提供更多的学习内容,但是除了蒸馏本身之外,它还增加了多少内容呢?为了隔离这一贡献,我们构建了 AMPLE-Math,这是一套可重复使用的 5,319 个数学问题,具有共享相同答案的六个推理视图,并将每个视图与匹配的无参考蒸馏进行比较。在有思维能力的老师监督直接回答采样轨迹的情况下,无参考蒸馏在思维能力评估下的 Qwen3-1.7B 的改进中发挥了重要作用,无论是在领域还是在外部基准上。 Qwen 中额外参考益处的证据是有限的,对于完善的解决方案而言最强,而完整的迹线在 SmolLM3-3B 中的第 50 步中增加了两个百分点。这些益处取决于接受训练的学生。在同一检查点,用长期的思考型推广取代短期的直接响应推广,会使两个家庭的收益变成损失,而问题、参考和评估保持不变。 Qwen 中的教师概况和匹配的损失干预措施进一步表明,改变词元级别的监督可以使学生的行为基本保持不变。总之,这些发现表明 OPSD 可以通过直接响应和思维推理所共享的参数来改善对现有推理能力的访问。特权参考的价值在于它为这种跨模式传输添加了什么,而不是它揭示了多少解决方案。