论文

UniPool:从短暂的全球访问中学习专家到层的所有权

UniPool: Learning Expert-to-Layer Ownership from Brief Global Access

摘要

大多数专家混合 (MoE) Transformer 在整个训练过程中将每个专家预先分配到一层。我们研究短暂的全局访问阶段是否可以学习兼容的专家到层分配,然后私下执行。 UniPool-Lock 在一个全局池上为每一层提供自己的路由器,平衡聚合池的使用情况,并通过规模稳定的 NormRouter 为专家评分。在短暂的所有权学习阶段之后,它将每个专家分配到一层,锁定不相交的分配,并继续作为层私有 MoE 进行训练。在相同的专家 FFN 预算和路由专家 FLOP 的情况下,该方案将 1.82M 到 1.5B 的 5 个密集等效规模相对于普通 MoE 的保留损失降低了 0.024-0.037,其中在 60B 词元之后的 1.5B 时为 -0.0247。所有权学习阶段持续 2K 步骤,约占训练的 3.3%,在我们的吞吐量测量中,锁定后步骤时间在普通 MoE 的 -0.7% 至 +2.8% 范围内。控制将增益定位在全池训练及其产生的分配中:在初始化时固定的随机不相交分配,使用相同的路由器和损失进行训练,与普通匹配,而锁定在全池阶段学习到的分配可以恢复几乎所有持久的全池增益,并且在锁定处替换随机分配会丧失大约一半的增益。在整个训练过程中保持全池访问 (UniPool-Full) 也比普通 MoE 在四个尺度上有所改进,并且其专家参数仅为 66.7% (182M) 到 50% (469M 和 650M)。