论文

局部自信,全局陷入困境:扩散语言模型中的质量探索困境

Locally Confident, Globally Stuck: The Quality-Exploration Dilemma in Diffusion Language Models

模型推理解码与生成控制

摘要

扩散 大语言模型 (dLLM) 理论上允许以任意顺序进行词元解码,这种灵活性可以比自回归 (AR) LLM 更丰富地探索推理路径。然而,在实践中,随机顺序解码通常会损害生成质量。为了缓解这种情况,低置信度重新屏蔽通过优先考虑置信词元来提高单样本质量(例如,Pass@$1$),但它也会抑制探索并限制多样本收益(例如,Pass@$k$),从而造成基本质量——探索困境。在本文中,我们对这一困境提供了统一的解释。我们表明,低置信度重新掩蔽改善了质量的短视代理,同时可证明限制了诱导序列分布的熵。为了克服这一限制,我们描述了明确平衡质量和探索的最佳分布,并开发了一个简单的独立大都市-黑斯廷斯采样器,在解码过程中大致目标为该分布。包括 MATH500、AIME24/25、HumanEval 和 MBPP 在内的一系列推理基准的实验表明,我们的方法比随机和低置信度重新屏蔽能产生更好的探索质量权衡。