论文

Self-Routing:基于隐藏状态的无参数专家路由

Self-Routing: Parameter-Free Expert Routing from Hidden States

摘要

专家混合 (MoE) 层通过仅激活每个token的一小部分专家来增加模型容量,并且通常依赖于学习路由器将隐藏状态映射到专家分配。在这项工作中,我们询问在我们研究的 MoE 设置中是否严格需要专用的学习路由器。我们提出了自路由(Self-Routing),这是一种无参数路由机制,它直接使用token隐藏状态的指定子空间作为专家逻辑,完全消除路由器投影,同时保持 MoE 层的其余部分不变。我们通过将 GPT-2 规模语言模型和 ImageNet-1K 分类的自路由与标准学习路由器、随机路由基线和密集非 MoE 基线进行比较来评估自路由。我们的结果表明,自路由与学习路由器基线相比仍然具有竞争力,同时删除了所有专用路由参数,并产生更平衡的专家利用率,平均归一化路由熵高出约 17%,并且没有明显的负载平衡损失。在带有 DeiT-S/16 的 ImageNet-1K 上,自路由也比相应的学习路由器 MoE 略有改进。这些发现表明,有效的 MoE 路由可以从隐藏表示本身中产生,而不需要单独的学习路由器模块。

Self-Routing:基于隐藏状态的无参数专家路由
图 3:逐层专家路由分数。每一行都是一个层,每一列都是一个专家。颜色越亮表示路由token的比例越大。自路由在最早的层之后表现出最均匀的分配模式,而学习路由器和固定随机投影则显示出更强的专家集中度和更多不活跃的专家。