论文
一个潜在的多个词元:联合学习压缩嵌入以实现高效的语言传播
One Latent, Many Tokens: Jointly Learning Compressed Embeddings for Efficient Language Diffusion
摘要
大多数连续扩散语言模型在每个采样步骤中处理每个标记的一个潜在位置,这使得生成成本昂贵。两阶段方法通过减少潜在长度来降低成本,但它们在训练扩散模型之前固定压缩的嵌入空间。来自固定空间的嵌入可能难以通过扩散进行建模并可靠地解码为词元,这限制了压缩后的生成质量。为了解决这个问题,我们引入了 JPEG-DLM(使用扩散语言模型进行高效生成的联合嵌入预测),它联合训练压缩器、流匹配模型和解码模块。通过联合嵌入预测,JPEG-DLM 可以学习更结构化的压缩嵌入,更容易通过扩散进行建模,并且可以可靠地解码为标记。 JPEG-DLM 在 LM1B 和 OWT 上的最新扩散和流动模型中实现了最低的平均 Gen-PPL 和最高的吞吐量。在 OWT 上压缩率为 0.5 时,它的 Gen-PPL 达到 34.52,大约是 ELF 吞吐量的 2.3 倍。这些结果表明,共同学习压缩嵌入为高效扩散语言建模提供了一条有希望的道路。代码即将发布。