论文

超越模仿:审核蒸馏模型中推理的可恢复性

Beyond Imitation: Auditing the Recoverability of Reasoning in Distilled Models

模型评测模型行为与机制分析

摘要

当接受的学生能够继续推理时,正确的教师解决方案就会成为有用的监督。我们通过前缀恢复来衡量这种兼容性:在显示经过验证的解决方案的 25%、50% 或 75% 后,我们测试学生是否正确完成它。我们将恢复与整个词汇表上交叉熵和反向 KL 梯度之间的余弦冲突联系起来。在从 0.6B 到 8B 参数的相邻 Qwen3 师生对中,反向 KL 蒸馏为低于 2B 参数的两个学生提供了最一致的数学和代码改进。在 1,000 个轨迹的固定队列中,随着学生规模从 0.6B 增加到 4B,平均前缀恢复率从 71.0% 上升到 91.9%,稳健与脆弱恢复差距从 46.0 个百分点缩小到 14.4 个百分点。当老师固定在 8B 时,冲突分离从 0.993 下降到 0.233。独立的客观干预在脆弱的轨道上发现了最大的反向 KL 救援。这三个测量定位相同的容量相关传输机制:当正确的迹线保持不均匀可恢复时,分布匹配具有最大的余量。前缀恢复为选择昂贵的分布级蒸馏提供了实用的诊断。