论文

E-MoE:非分解扩散语言模型的增强专家混合

E-MoE: Enhanced Mixture-of-Experts for Non-Factorized Diffusion Language Models

摘要

掩蔽扩散模型 (MDM) 通过在每个去噪步骤中逐步揭开多个标记来生成序列,但其逆过程通常会根据位置进行因式分解,从而限制了少数步骤范围内的样本质量,其中扩散相对于自回归解码的速度优势最为重要。最近的一项工作引入了连续高斯潜伏,被训练为变分自动编码器,以捕获跨位置的相关性,但这种方法很容易发生后验崩溃,其中潜伏被默默地忽略。我们提出了增强型专家混合(E-MoE),它将反向过程构建为在由专家混合(MoE)主干的专家路由决策给出的离散共享潜在变量上的分解分布的混合,而不增加分解基线上的活动参数。在综合多模态基准、二值化 MNIST 和 LM1B 中,E-MoE 改进了因式分解基线的几步生成。