论文
利用预训练语言模型作为格劳伯动力学文本扩散的能量函数
Leveraging Pretrained Language Models as Energy Functions for Glauber Dynamics Text Diffusion
摘要
我们使用统计物理学中的格劳伯动力学提出了一种基于离散扩散的语言模型。我们的主要见解是,我们可以建立一个基于预训练的因果/掩码语言模型的“能量函数”,而不是尝试使用格劳伯动力学以统一的转移核作为前向过程来训练离散状态空间扩散模型。当被视为平稳分布时,这种能量函数使我们能够显着提高生成文本的质量。将 UL2 作为预训练模型纳入我们的扩散管道中,我们的性能优于先前基于扩散的 LM,并且与模型大小相当的自回归模型具有竞争力。此外,我们的模型在零样本常识推理任务以及数独和斑马谜题等规划和搜索任务上与先前的扩散模型和 GPT-2 式自回归模型具有竞争力或优于先前的扩散模型和 GPT-2 风格的自回归模型。