论文

LLaDA MoE v2:扩展混合专家扩散语言模型

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models

摘要

扩散语言模型(dLLMs)提供了一种替代方法,即自回归(AR)语言建模。然而,混合专家(MoE)dLLMs的性能扩展行为仍不清楚。我们系统地研究了混合专家dLLMs中的优化超参数、计算分配和架构如何随规模变化,识别出与先前报告相比存在定量差异。具体而言,在优化方面,最佳的基准批量大小增长更快,而最佳的学习率随着计算资源的减少而衰减得更快。在模型-数据分配方面,ISOFLOP分析揭示了轻微的数据侧倾斜:最佳的令牌预算比激活的模型侧计算增长得更快。对于混合专家架构,随着固定激活容量的增加,更大的规模倾向于使用更大的专家池,而中等专家粒度始终保持有效且共享专家的比例在所有尺度上都保持稳定不变。基于这些发现,我们从头开始训练了LLaDA MoE v2,这是一个30B-A3B的dLLM,使用23.5T令牌进行预训练。与Qwen3相比,LLaDA MoE v2在知识、推理和编程基准上大约有65%的预训练令牌数量。经过单独的监督微调后,它超越了SDAR Chat,在七个推理和编程基准上的性能优于后者,并且在几个任务上接近于Qwen3。这些结果确立了混合专家dLLMs的实际扩展规律和设计原则。

LLaDA MoE v2:扩展混合专家扩散语言模型:论文配图
图 4:MoE 架构扩展。我们评估激活的模型端预算的不同分解如何影响跨计算规模的训练损失。 (a):激活比率 AA,(b):专家粒度 GG,以及 (c):共享专家比率 SS。颜色表示激活的模型端预算 M*​(C)M^{*}(C),红色星号标记每个计算规模的最低损耗配置。