论文

AURORA-LM:连续潜在扩散语言建模的自动编码统一表示

AURORA-LM: Autoencoding Unified Representation for Continuous-Latent Diffusion Language Modeling

模型架构新型架构

摘要

语言在生成建模中仍然是一个异常值:虽然图像、视频和音频越来越多地在连续潜在空间中建模,但文本生成仍然主要依赖于离散标记。现有的连续语言模型要么继承不是为联合生成和解码而设计的嵌入空间,要么压缩自动编码的潜在变量以方便扩散,从而牺牲 词元级 保真度。我们没有简化表示以适应生成模型,而是保留高容量、可解码的潜在文本,并设计扩散模型来直接学习其分布。我们引入了 AURORA-LM,一种连续潜在扩散语言模型,它将可解​​码文本表示的构建与其分布建模分开。基于查询的编码器-解码器将文本组织成大容量、前缀对齐的潜在序列,块因果扩散 Transformer 通过流匹配学习其分布,从左到右生成块,同时并行对每个块内的位置进行去噪。由于这种潜在模型更难扩散到模型,因此 AURORA-LM 仅限制噪声输入路径,同时保留完整的干净潜在预测目标,在不减少面向解码器的容量的情况下容纳全宽度潜在模型。我们进一步将噪声水平分布校准到潜在宽度,并引入自轨迹一致性来桥接独立采样的训练噪声和推理时的迭代去噪。 AURORA-LM 在 OpenWebText 自由生成和 XSum 总结方面在评估的连续和基于扩散的语言模型中实现了最强的性能。通过大约 1500 EFLOP 的总计算量扩展到 1B 参数可以产生进一步的收益,超过了匹配评估协议下更大的公开发布的潜在扩散语言模型。所有实验均在 Ascend NPU 上进行。