论文
蒸馏 陷阱和防护装置:LLM 蒸馏度的校准旋钮
Distillation Traps and Guards: A Calibration Knob for LLM Distillability
摘要
知识蒸馏 (KD) 将 大语言模型 (LLM) 的功能转移给较小的学生,但它可能会出现不可预测的失败,并且还会带来模型泄漏风险。我们的分析揭示了几个 蒸馏 陷阱:尾部噪声、离策略 不稳定性,以及最根本的扭曲训练信号的师生差距。这些陷阱表现为过度自信的幻觉、自我纠正崩溃和本地解码退化,导致蒸馏失败。受这些发现的启发,我们提出了一种事后校准方法,据我们所知,该方法首次能够通过强化 微调 (RFT) 来控制教师的可蒸馏性。我们的目标结合了任务实用性、KL 锚点和跨标记器校准奖励。这使得可蒸馏性成为基础模型的实用安全杠杆,将强大的师生迁移与部署感知模型保护联系起来。数学、知识 QA 和指令跟踪任务的实验表明,从可蒸馏的校准教师中蒸馏出来的学生优于 SFT 和 KD 基线,而不可蒸馏的校准教师保留了他们的任务表现,但导致蒸馏学生崩溃,这为更好的 KD 和模型 IP 保护提供了实用的旋钮。