论文
Latent-MOPD:表征级多教师在线蒸馏
Latent-MOPD: Latent Multi-Teacher On-Policy Distillation
摘要
在线蒸馏(OPD)在学生自生成的响应上训练学生。现有LLM多教师OPD通过输出分布转移专家预测。我们提出Latent-MOPD——据我们所知首个LLM表征级多教师OPD方法:不经额外教师训练,同时通过专家的预测及其计算所用的隐状态整合现有专家。为协调多专家的表征监督,按教师-学生关系选择后层目标、以共享投影桥接不等的隐藏宽度、按域分组更新;每位教师的监督从隐状态逐渐过渡到token预测,两通道使用同一路由专家。在同族主设置中,Latent-MOPD在数学、代码与逻辑的全部九个基准上超过仅token、仅表征与均匀平均三种基线;在与每位教师相同参数量下,学生在多数基准上超过各基准最佳教师;使用更大且独立开发的跨族教师时,Latent-MOPD在全部基准上优于两种单通道基线。同族全层仅表征对照在域纯更新下保持稳定,但在单次更新内交织教师域时崩溃。结果表明单一学生可通过输出分布与内部表示双通道整合多专家能力。