论文
从不协和到编排:教师干预在on-policy蒸馏中
From Dissonance to Orchestration: Teacher Intervention in On-Policy Distillation
摘要
on-policy蒸馏 (OPD) 使用更强大的老师的反馈来训练学生自己的推理轨迹。教师的干预可以改善这些轨迹,但也可以改变学生学习的分布。我们的对照研究表明,仅rollout质量并不是分配教师指导的完整标准。更深入的干预会导致rollout准确性的收益逐渐减少,同时增加off-policy负载。在实施范围有限的训练探索中,学生的最高准确率和表现保持力有利于不同的干预强度。首选的干预深度和位置也因基准而异。这些发现激励了 MAESTRO,它利用局部策略的分歧来共同适应教师接管的时间和产生的时间。其{策略分歧得分}将教师加权的候选覆盖率与局部分布相似性相结合,并在推理段落中聚合。在八个数学推理基准测试中,MAESTRO 在比较方法中为 0.6B 和 1.7B Qwen3 学生实现了最高的宏观平均准确度,其中 1.7B 学生在每个基准测试中均领先。相对于标准 OPD,MAESTRO 还将平均训练响应长度缩短了 67.3%。该代码可在 https://github.com/yhao-wang/MAESTRO. 获取