论文
专家混合中任务路由的理论模型 Transformer
A theoretical model for task routing in mixture-of-expert transformers
摘要
专家混合 (MoE) 层可以扩展 Transformer 模型,同时保持推理计算固定。虽然在前沿 MoE Transformer 模型的实证研究中已经观察到任务专家专业化,但现有的理论工作使用连续混合模型来分析这一点,而该模型无法用于有效地模拟自然语言。一个重要的开放问题是 \textit{使用离散语言模型从理论上解释 Transformer MoE 模型中的任务专家专业化}。为了解决这个问题,我们通过句法模板和有限键值字典表示结构化知识,并正式证明单层 MoE Transformer 可以通过使用专门从事相应任务的专家来编码知识。我们的构造展示了如何将查询路由到独特的、特定于任务的专家,其大小仅取决于给定任务的内在复杂性(即其语法模板和事实词典的组合大小)。我们的构建为 MoE 模型中本地化知识回路的实证结果提供了理论支持。我们通过评估不同 MoE 损失函数下模型性能的实验来支持我们的理论发现。