论文

现在谁应该领导解码?跟踪集成掩模扩散语言模型的可靠轨迹

Who Should Lead Decoding Now? Tracking Reliable Trajectories for Ensembling Masked Diffusion Language Models

模型推理解码与生成控制

摘要

掩蔽扩散语言模型(MDLM)已成为序列生成的独特范例。随着 MDLM 的能力和知识覆盖范围变得多样化,一个重要的问题是如何结合他们的知识。为此,我们首先研究 MDLM 独特的解码动态。我们发现,成功的一代在与答案相关的位置上表现出稳定的置信动态,而不可靠的轨迹通常可以通过从其他模型注入有希望的中间状态来纠正。在这一观察的指导下,我们提出了 $\textbf{TIE}$ ($\textbf{T}$rajectory-based $\textbf{I}$terative $\textbf{E}$nsembling),这是一种知识融合框架,其中 MDLM 迭代地识别可靠的解码轨迹并在模型之间中继它们。 TIE 跟踪与答案相关的位置的置信度动态,以确定当前哪个模型遵循更可靠的轨迹,并选择性地跨模型传输部分去噪的序列。由于更有前景的轨迹上的模型经常在去噪步骤中发生变化,TIE 允许不同的模型在不同的生成阶段贡献互补的优势。在各种推理任务中的出色表现以及我们的分析表明,TIE 为解决 MDLM 集成的未充分探索的问题提供了一种实用的方法。