论文

超球面流的语言建模

Language Modeling with Hyperspherical Flows

模型架构新型架构

摘要

受并行生成能力的推动,离散扩散语言模型作为自回归 (AR) 模型的替代方案发展迅速。然而,为了易于处理,离散扩散模型从分解分布中采样,其表现力不如 AR。最近的流语言模型 (FLM) 将连续流应用于语言,通过确定性 ODE 将噪声传输到数据,从而避免因式分解采样。 FLM 在 one-hot 向量上运行,其维度随词汇量大小而变化,这使得 FLM 的训练成本很高。此外,由于所有不同的 one-hot 嵌入在 $\ell_2$ 中都是等距的,因此添加高斯噪声没有清晰的语义解释(与图像不同,高斯噪声逐渐降低结构)。我们引入$\mathbb{S}$-FLM,一个超球面中的潜在FLM。 $\mathbb{S}$-FLM 通过沿着通过交叉熵学习的速度场旋转 $\mathbb{S}^{d-1}$ 中的向量来生成序列,避免了具体化 one-hot 向量的开销。以前的 FLM 在生成困惑度 (Gen.\ PPL) 方面与 AR 相匹配,但可能性较高的样本在数学和代码等可验证领域不一定是正确的。 $\mathbb{S}$-FLM 极大地改进了大词汇量推理的连续流语言模型,并缩小了标准温度采样($T=1$)下与掩蔽扩散的差距,而优化低温($T=0.1$)解码下的差距仍然存在。