论文
用于少步生成的潜在内核离散流图
Latent-Kernel Discrete Flow Maps for Few-Step Generation
摘要
离散扩散和流匹配模型通过多个步骤对序列进行降噪,但为了保持每个步骤的成本低廉,它们分解了位置之间的转换并独立决定每个标记。当目标耦合两个位置(例如必须一致的主语和动词)时,这使得几步生成对于文本来说具有挑战性。独立更新分别提交给它们,并且许多功能评估都花在修复不匹配上。现有的几步方法通过提炼或纠正缓慢的教师来买回失去的相关性,从而继承了教师的质量上限。相反,我们询问模型是否可以原生表达相关步骤,并用潜在内核离散流图 (LKF) 进行回答,这是一个从头开始的流图内核,它是由单个共享潜在变量绑定的 M 分解组件的混合物。以潜在变量为条件,每个组件都很便宜,并且混合物以小 M 的封闭形式对潜在变量求和。我们表明,单个步骤将质量放在相关完成上,具有与分解模型相同的采样时间复杂度,因为每个序列都会绘制一个潜在变量,并在整个去噪轨迹中重复使用。我们还表明,掩蔽扩散语言模型 (MDLM) 是 M=1 时 LKF 模型的特例。在十亿字 (LM1B) 和 WikiText-103 基准上进行的无条件文本生成实验表明,我们的 LKF 模型学习了强异构成分,并将生成困惑度比似然基线提高了 2.1 倍到 3.3 倍,而不会损失多样性。增益随着 M 的增加而增长,并且在 M=8 时,它超越了蒸馏和整流的少步采样器。源代码位于:https://github.com/mansoor181/lkf.git