论文

缩放和提炼文本嵌入以获得更好的扩散性

Scaling and Distilling Text Embeddings for Better Diffusibility

摘要

扩散语言模型 (DLM) 为自回归 (AR) 语言生成提供了一种有前途的替代方案。连续 DLM 的最新进展将潜在扩散应用于连续文本嵌入,提出了一个实际问题:哪种嵌入产生最佳潜空间,即最可扩散?为了回答这个问题,我们搜索了不同的嵌入,发现将嵌入模型扩展到同一族中更强的模型(T5 到 T5Gemma-1 到 T5Gemma-2)可以极大地提高生成性能。但原始 T5Gemma-2 嵌入仍然不是最佳的。它们具有如此大的歧视性,甚至连看似合理的替代词的嵌入也是分开的,这使得这一代人很容易受到不完美采样的影响。因此,连续扩散通常无法到达其中任何一个,而最终导致无效的嵌入。为了解决这个问题,我们将 T5Gemma-2 提炼成一个学生编码器,该编码器将老师的解码概率学习为软标签。从此类软标签中学习可以使学生在保持编码解码机制的同时将替代嵌入拉得更近。蒸馏后的嵌入形成了一个更加连接和可扩散的潜空间,比普通的 T5Gemma-2 嵌入有所改进。结果,我们的中型 DLM 在 OpenWebText 上的真实文本熵上达到了 Gen. PPL 17.8(相对于真实文本 PPL 15.4),优于 Gen. PPL 上的 GPT-2-M。