论文

SF-MOPD:快慢多教师在线蒸馏

Slow-Fast Multi-Teacher On-Policy Distillation for Capability Preservation

摘要

基础多模态大语言模型旨在支撑跨域的广泛能力。多教师在线蒸馏(MOPD)能把领域专长整合进单一学生模型,但训练会逐渐把学生推离其初始化模型,位移增大时通用能力衰退,造成能力干扰。直接 remedies 是把学生约束向初始化,但这也会压制领域专长的习得。我们提出快慢多教师在线蒸馏(SF-MOPD):把由各教师直接更新的快速模型(当前学生)与学生指数移动平均的慢速模型耦合。慢速模型逐渐吸收学习信号,充当融合通用基础与已确认领域专长的移动能力参照。对每个教师,SF-MOPD在对数概率空间计算教师诱导更新,只移除把快速模型推离慢速模型的分量,保留一致与正交分量。多个模型规模的实验表明,SF-MOPD有效缓解能力干扰、增强专门多模态能力并降低通用能力基准的平均退化,持续优于原版MOPD。