论文

ConvergeFlow:可证明与词元嵌入收敛的语言流

ConvergeFlow: Language Flow with Provable Convergence to Token Embeddings

模型训练预训练

摘要

连续扩散和基于流的语言模型 (LM) 的最新进展已经取得了与离散 LM 相媲美的性能。然而,现有的连续框架仍然依赖于交叉熵(CE)监督的解码器,因为不能保证流轨迹在有效的词元嵌入处终止。受此限制的启发,我们引入了 \textbf{ConvergeFlow},一种基于嵌入空间流的 LM,它将数据预测器限制为词元嵌入的凸包,并仅使用流匹配引起的均方误差目标对其进行训练。在适当的规律性条件下,我们证明,尽管数据预测器存在错误,结果流仍会收敛到有效的词元嵌入,从而无需 CE 监督的解码器即可直接进行词元预测。我们进一步开发了三种采样机制来控制生成困惑度和熵之间的权衡。 OpenWebText 上的实验表明,ConvergeFlow 的性能可与现有的连续和离散扩散 LM 相媲美。这些发现证明了基于流的语言建模范式的潜力。我们的代码可在 https://github.com/Na-Li66/ConvergeFlow 获取。