论文
PADD:路径对齐解压 蒸馏,供非路由器教师指导 MoE 学生学习
PADD: Path-Aligned Decompression Distillation for Non-Router Teacher to Guide MoE Student Learning
摘要
随着 大语言模型 (LLM) 的不断扩展,在固定计算预算下增加模型容量变得越来越具有挑战性。我们提出了路径对齐解压缩 蒸馏 (PADD),这是一个框架,用于从密集的教师中提取知识,而无需显式路由到混合专家 (MoE) 学生,同时学习高质量的路由策略。 PADD 将 知识蒸馏 分为两个阶段的四个阶段:初始化阶段(阶段 I),通过教师神经元聚类和学生专家预热,在学生专家中构建不同的功能;训练阶段(阶段 II--IV),将在线自适应 蒸馏、路径细化策略优化和奖励增强负载平衡集成在单个训练管道中。数学推理基准实验表明,在相同的推理成本下,PADD 比强基线产生了显着的收益,并且 MoE 的学生可以匹配或超过其密集的老师。他们还展示了有效的师生 知识蒸馏 和稳定的路由行为。