论文

不停歇地解决问题:小规模的合规蒸馏

Solving Without Stopping: On-Policy Distillation at Small Scale

模型评测模型行为与机制分析

摘要

在on-policy蒸馏中,学生从更强大的教师对其输出的反馈中学习,是将推理传递给较小模型的常见方法。我们以小规模分析它转移的内容,将 Qwen3-8B 提炼成 Qwen3 4B、1.7B 和 0.6B 学生,在思维模式(详细推理,然后结束推理和答案)下,并在非思维模式(没有单独的推理阶段)下进行比较。长推理需要两种能力,解决问题和知道问题何时解决,我们发现蒸馏转移了第一种能力,但在思维模式中却转移了第二种能力。解决问题在每个规模上都有所提高,最多可达两个上限,我们对两种模式和所有学生规模进行了综合衡量:学生的单次尝试永远不会超过其在训练前多次尝试中已经达到的水平,而且学生越小,其低于教师的水平就越远。停止是模式分开的地方。在非思考模式下,每个学生都不断停下来;在思维模式中,学生在训练早期就停止结束推理,而且学生越小,这种能力的保留就越少:老师几乎只在学生已经结束推理的地方发出停止信号,所以蒸馏不会教新的停止;它只保留学生现有的到达正确答案的止损点,而成绩较差的学生几乎没有这样的止损点。最小的学生通常会达到正确的值,但不会承诺:他们要么很少标记它,要么标记它并写过去。这些结果共同描述了小学生on-policy蒸馏下的表现,以及区分答案标记、正确性和停止的诊断。