论文

重新评估掩码扩散语言模型中的置信度重新掩码

Re-evaluating Confidence Remasking in Masked Diffusion Language Models

模型评测模型能力评测

摘要

掩码扩散语言模型 (dLLM) 最近已成为自回归语言模型的竞争替代品,有望通过并行词元生成实现更快的推理。然而,屏蔽公式的一个显着限制是,一旦词元被揭露,它就不能再被修改,从而使 dLLM 容易受到早期抽样错误的影响。为了解决这个问题,越来越多的工作试图扩展具有自我纠正(重新屏蔽)功能的屏蔽 dLLM。这些方法的一个有吸引力的子集以 无需训练 的方式实现,这是基于词元置信度的事后方式,并具有令人鼓舞的早期报告结果。在这项工作中,我们重新审视了对代表性事后重屏蔽方法 WINO [Hong et al., 2026] 的实证评估,发现在标准解码设置(较短的块长度)下,它比单独基于置信度的去屏蔽几乎没有带来任何好处 [Wu et al., 2025]。将评估扩展到非贪婪解码,我们发现虽然基于置信度的重新屏蔽可以在一定程度上减轻随机性增加带来的错误,但它也加剧了之前报道的基于置信度的去屏蔽的多样性崩溃。总体而言,我们的结果表明,事后基于置信度的重新屏蔽的好处高度依赖于设置,这强调了对更全面的评估框架的需要。