论文
在线蒸馏传递新技能,但不一定传递新知识
On-Policy Distillation Teaches New Skills but Not New Knowledge
摘要
在策略蒸馏(OPD)加强了语言模型推理,但学生是否获得了新的事实知识或多步推理的组合技能仍然未知。我们使用受控综合框架来分离这些能力,该框架衡量学生的初始能力并独立控制教师的附加事实、作文技能或两者。在来自三个系列的四个模型中,reverse-KL OPD 可靠地跨看不见的推理结构传递了组合技能,但传递了最少的事实知识。解耦蒸馏配方揭示了这种不对称的根源:用正向 KL 替换反向 KL 可以恢复事实传递,而学生Rollout则专门改善了多步推理的执行。最近的事实 QA 和竞赛数学实验表明,在反向 KL OPD 下也存在类似的不对称性,无需事实记忆扩展即可产生显着的推理增益。总之,这些结果表明,同策略蒸馏并没有扩展模型的参数知识,而是教会它 组织和组合它已经拥有的知识。