论文

给提示加噪:连续扩散语言模型的条件Token训练

Noise Your Prompt: Noising Conditioning Tokens in Continuous Diffusion Language Models

模型训练模型推理应用与实践预训练推理策略与问题分解机器翻译

摘要

我们重新审视连续扩散语言模型文献中公认的标准实践,即在训练期间修复条件提示标记。我们做了一个非常简单的修改:在训练期间也发出条件提示标记的噪音。我们证明,在修改后的训练目标下,我们在数独和 N-皇后等组合推理任务中实现了更好的泛化,在较难的变体上获得了最大的收益(数独 Hard 上的解决率从 3.73\% 增加到 24.65\%$),并且生成的解决方案的多样性增加(10x10 N-皇后的覆盖率从 50.60\% 到 73.79\%$)。我们还展示了通过 Gigaword 摘要在适度的数据集体系中自然语言生成质量的可测量改进,但值得注意的是,这些收益并没有转移到所有自然语言任务(例如开放式对话生成)。我们的方法是对训练目标的单行更改,默认情况下不需要额外的推理成本,并提供无分类器指导启发的引导采样的灵活性。我们的 \href{此 https URL} {code} 是公开可用的。

给提示加噪:连续扩散语言模型的条件Token训练:论文原图
图 1:对条件Token进行噪声处理可提高解决方案的多样性。 (a) 单个保留的 N 皇后 (8×88\times 8) 谜题的五个棋盘代,允许六个不同的有效解决方案(通过颜色和字母区分)。使用噪声调节Token训练的模型(pcondclean=0.2p_{\text{condclean}}{=}0.2,顶部)将其世代分布在解决方案集(4/64/6 个不同的解决方案)中,而在整个训练过程中保持调节Token干净的标准“粘贴”模型(pcondclean=1.0p_{\text{condclean}}{=}1.0,底部)模式崩溃为单个完成。 (b) 解决方案覆盖率作为输入板承认的有效解决方案数量的函数,超过 750750 个保留的 10×1010\times 10 谜题,每个谜题 k=20k{=}20 代。在每个解决方案计数中,噪声提示模型都优于干净提示模型。我们在 4.4 节中量化了这一差距。