论文

MOPD-Router:逐 token 路由多教师在策略蒸馏监督

MOPD-Router: Rethinking Teacher Routing in Multi-Teacher On-Policy Distillation

摘要

多教师策略蒸馏 (MOPD) 将专业能力集成到单个学生中,但现有实践通常将每个提示硬路由给领域匹配的教师以进行整条采样轨迹。这种对提示级域标签的依赖限制了使用未标记的训练混合物,并且使其他教师的补充信号无法使用。我们引入了 MOPD-Router,这是一个框架,可以在每个token上对整个教师池的监督进行路由,无需域标签或训练单独的路由模型。其插件接口支持不同的指标来选择和加权教师特定的 OPD 信号。在这个接口中,我们提出了 ExpertAlign,它根据当前标记对学生的校正是否表达了教师在训练后获得的专业化来对每个教师进行评分,并将其与基于教师置信度(熵)和师生差异(新颖性)的两个参考指标进行比较。在强到弱和相同大小蒸馏场景下对未标记和域标记训练混合物进行的实验表明,ExpertAlign 在所有四种设置中都实现了最强的整体性能。在未标记数据上,它比平均聚合提高了 5.88 (+12.3%) 分;在域标记数据上,在不使用可用域标签的情况下,它的性能比标准 MOPD 高 3.95 (+7.8%) 个点。这些结果表明词元级路由可以利用跨域互补监督,并减少对提示级域分配的排他性依赖。代码位于:https://github.com/TURLEing/MOPD-Router。

MOPD-Router通过逐token路由组合教师监督,依据教师专长对齐学生更新。
图1(图注摘要):MOPD-Router通过逐token路由组合教师监督,依据教师专长对齐学生更新。