论文
KDFP:大型语言模型中知识蒸馏的第一原理方法
KDFP: A first-principles approach to knowledge distillation in large language models
摘要
知识蒸馏是一种成熟的技术,通过使用更大、更有能力的教师模型的表示来训练小型、高效的学生模型的能力。最近在大型语言模型(LLM)提炼方面的大部分工作都集中在提炼在训练后学到的能力,例如指令遵循、思维链推理和工具使用。这在LLM的一般知识提炼方面留下了巨大的研究空白,这对于开发适合部署在边缘设备上的高效且私有的系统至关重要。我们采用第一性原理方法,评估之前工作中的经验教训,并进行新的探索,以开发适合现代LLM的蒸馏方法。我们提出了 KDFP,一种用于LLM白盒常识蒸馏的新颖方法。我们证明,KDFP 在 9 个基准测试中的性能优于现有方法 1.6% - 4.9%,同时通过短暂参数减少将训练效率提高高达 99.1%。