论文

利用混合专家流匹配实现更快的语言模型推理

Towards Faster Language Model Inference Using Mixture-of-Experts Flow Matching

摘要

流匹配(flow matching)在保留扩散模型生成质量的同时支持大幅更快的推理,是一种颇具吸引力的生成建模范式。然而,应用于语言建模时,它在表示具有不规则几何结构的复杂潜在分布(如各向异性与多模态)方面存在根本局限。为应对这些挑战,我们提出混合专家流匹配(MoE-FM)框架,通过将潜在空间中复杂的全局传输几何分解为局部特化的向量场来加以刻画。在MoE-FM基础上,我们开发了一种名为YAN的非自回归(NAR)语言建模方法,并同时给出Transformer与Mamba两种架构实例。在多个下游任务上,YAN取得与自回归(AR)语言模型及基于扩散的NAR语言模型相当的生成质量,而所需采样步数最少仅为3步。这使其相对AR基线获得40倍加速,相对扩散语言模型最高获得10^3倍加速,展示了语言建模在效率上的显著优势。

利用混合专家流匹配实现更快的语言模型推理:论文配图
图 2:普通流匹配 (VFM) 和专家混合流匹配 (MoE-FM) 在合成数据集上的比较。 (a) 网格和 (b) 半月数据的结果表明,MoE-FM 可以更准确地恢复具有不规则几何形状的数据分布,包括断开、弯曲模式和非线性低维流形。此外,MoE-FM 学习从噪声到数据的更直的传输轨迹,从而以更少的采样步骤提高生成性能。