论文

低于本底噪声:小型 知识蒸馏 中的双峰种子塌陷和独特的失效模式

Below the Noise Floor: Bimodal Seed Collapse and Distinct Failure Modes in Small-Model Knowledge Distillation

模型评测鲁棒性、公平性与可信度评测

摘要

函数路由(根据自然语言请求从固定目录中选择正确的 API 调用)是一个部署问题,其中小学生很有吸引力,但 知识蒸馏 增益通常以单种子报告,且种子方差未知。在具有 1.5B Qwen 学生和 20B 教师的 740 个实例的医疗保健 API 路由任务中,我们将八个 KD 变体与监督交叉熵进行比较,使用三到六个种子进行关键配置。我们发现:(i) 每颗种子的标准偏差范围为 2.8 至 48.7 个百分点,将每个声称的 KD 增益吞没在 5 个百分点以下; (ii) 7 个 KD 变体中的 3 个表现出双峰崩溃,其中至少有三到五颗种子的准确度低于 55%,而其他种子训练正常,第四个变体表现出较高的方差; (iii) 崩溃具有不同的模式——ce_kd 和 ce_paraphrase 的错误函数选择,以及先前未记录的 Reasoning_kd 的输出截断模式,其中模型发出推理,但在生成函数名称之前终止(0.9% 准确度); (iv) 只有progressive_kd 和rank_kd 避免了观察到的种子的崩溃,且sigma <= 3.9 pp; (v) 在受控的内分割多种子重新测试下,输入富集的原始交叉分割+3.78 pp 增益反转为-2.70 pp。因此,单种子评估无法检测小模型 KD 中的中心失效模式。