论文
重新思考扩散语言模型中并行解码的软词元
Rethinking Soft Tokens for Parallel Decoding in Diffusion Language Models
摘要
扩散语言模型 (DLM) 通过在每个去噪步骤中预测和提交多个标记来实现并行生成,但它们可以生成单独可信但相互不一致的标记。最近的工作表明,soft tokens 可以通过根据前一个解码步骤中模型的预测分布构建的连续嵌入来表示不确定位置,从而缓解这个问题。然而,尽管软词元通常被理解为保留预测不确定性,但软词元反馈如何改进并行解码尚未得到系统研究。在本文中,我们在冻结的预训练 DLM 中研究这个问题,以检查软词元反馈,而无需额外训练的影响。为了在免训练的环境中构造软词元输入,我们确定了传统软词元构造和预训练嵌入空间之间的几何不匹配。基于这一观察,我们提出了一种免训练、几何感知的软词元构造。我们对软词元反馈的分析表明,仅保留不确定性并不能完全解释它如何重塑后续预测。为了更好地解释软词元反馈如何改进并行解码,我们提供了经验证据,证明它有利于连贯的词元序列。在四个预训练的 DLM 和四个数学和代码基准测试中,我们的方法优于标准并行解码和免训练的欧几里德软词元基线。代码:https://github.com/kodaikawamura/rethinking-soft-tokens