论文
IntBMoE:将块级调节集成到专家组合中,以实现专家的全面参与混合
IntBMoE: Integrating Block-Level Conditioning into Expert Composition for Full-Participation Mixture-of-Experts
摘要
专家混合 (MoE) 可以扩展容量,但现有设计无法独立设置三个量。对于单个词元,参与是指有多少专家为其输出贡献知识,执行是指实际计算了多少专家(计算成本),具体化是指必须构建和存储多少专家大小的参数集(内存成本)。稀疏路由使执行和实现保持较低水平,但缩小了参与度:对于每个词元,只有少数专家做出贡献。密集的输出混合恢复了充分的参与,但其执行力随着专家数量的增加而增长。参数合并使执行由一位专家负责,但其具体化随着路由决策的数量而增长。我们提出了 IntBMoE,一种块条件 MoE,它通过将密集的专家组合与稀疏的块执行配对来解耦这三者。它的块来自一本小的学习密码本,每个条目一个。在每个内部层,轻量级超网络将该层池中的所有专家库合并为一个组合专家。参与是充分的,因为每个组成的专家都会利用整个池子。执行保持稀疏,因为路由器仅将每个词元发送到几个块。物化是有界的,因为密码本(而不是输入)确定了存在的块数量。双路径剩余门控 (DPRG) 通过乘法门控进一步耦合两个独立组成的路径。图像分类实验表明,与代表性的稀疏和密集 MoE 基线相比,获得了一致的增益。关于语言建模和顺序推荐的额外实验验证了其超越视觉的泛化能力。 IntBMoE全面部署在高德生成推荐系统中,在60ms的延迟预算下为数亿用户提供服务,在线A/B测试中相对UVCTR增益达到2.4%。我们的代码可以在这个 https URL 上找到。