论文
元学习在哪里分配专家:MoE 的任务条件分层压缩
Meta-Learning Where to Allocate Experts: Task-Conditioned Layer-Wise Compression for MoEs
摘要
专家混合 (MoE) 模型将每个词元路由到专家网络的子集,增加容量,同时保持每个词元计算稀疏。在许多已部署的 MoE 中,尽管层角色和专家冗余随深度和需求随难度的变化而变化,但跨层和任务的活跃专家数量是固定的。现有方法仅解决此设置的一部分:逐层分配通常离线确定并重用于所有任务,而 词元级 方法使用本地路由信号而不需要任务级上下文来改变专家激活。我们提出了 MetaNet,一种支持集控制器,可以为每一层预测专家保留阈值和有界路由偏差。主干网、专家和路由器仍然冻结。在 DeepSeek-MoE-16B-Chat 上,MetaNet 提供了可调节的准确性-专家-激活权衡。相对于固定 k=6,保守设置平均激活 3.61 个专家(减少 40%),并达到相当的 MMLU 准确度(0.489 比 0.474),而激进设置平均激活 2.28 个专家(减少 62%),准确度大约低 3.7 个百分点。经过 MMLU 训练的控制器也无需重新训练即可转移到 C-Eval,以 0.386 的精度平均激活 2.90 个专家(比固定 k=6 少 52%)。