论文
有特权但有偏差:特权信息条件教师如何破坏自蒸馏
Privileged, but Biased: How PI-Conditioned Teachers Break Self-Distillation
摘要
自我蒸馏(SD)作为一种计算效率更高的替代方法,与可验证奖励相结合:一个自教师,基于特权信息(PI),如参考解决方案,为学生提供密集的每令牌监督。然而,报告的收益几乎完全来自狭窄、低难度设置,留下了一个基本问题:在没有奖励的情况下,作为单一目标,SD是否教任何东西?我们重现SDPO报告的收益,在其容易设置下,然后应用相同的设置到困难任务上,发现它并不如此。在问答、数学、编程和多轮交互工具使用方面,无论推理模式如何,无论模型大小还是PI的形式,无论SDPO还是OPS D的配方,每令牌损失稳步下降,而验证准确率并未改善,通常恶化。我们通过一个因果链来解释这一失败:从损失到生成的模型。偏差开始于PI偏见:由于看到一个特定的参考解决方案,教师的每令牌目标被拉向特定轨迹而不是一般正确性,我们用PI偏见分数量化这种效应。训练以匹配这个目标,学生的主观目的是几乎看不见是否是一个正确的滚动,因此它对低信息度的令牌(如停顿符、标点符号、不确定性标记)分配了大部分损失,而这些令牌决定了答案;在正确的滚动中,探索性的令牌导致最大的差异,因此它惩罚了推理过程中需要犹豫的犹豫。结果是更平滑、不决定性更强的学生,但在推理方面并不比其他方法更好:作为单一目标,SD优化与任务成功无关的信号。
