论文
利用混合专家流匹配实现更快的语言模型推理
Towards Faster Language Model Inference Using Mixture-of-Experts Flow Matching
摘要
流匹配(flow matching)在保留扩散模型生成质量的同时支持大幅更快的推理,是一种颇具吸引力的生成建模范式。然而,应用于语言建模时,它在表示具有不规则几何结构的复杂潜在分布(如各向异性与多模态)方面存在根本局限。为应对这些挑战,我们提出混合专家流匹配(MoE-FM)框架,通过将潜在空间中复杂的全局传输几何分解为局部特化的向量场来加以刻画。在MoE-FM基础上,我们开发了一种名为YAN的非自回归(NAR)语言建模方法,并同时给出Transformer与Mamba两种架构实例。在多个下游任务上,YAN取得与自回归(AR)语言模型及基于扩散的NAR语言模型相当的生成质量,而所需采样步数最少仅为3步。这使其相对AR基线获得40倍加速,相对扩散语言模型最高获得10^3倍加速,展示了语言建模在效率上的显著优势。
