论文
用于掩蔽扩散语言模型的注意力折扣自适应采样器
Attention-Discounted Adaptive Sampler for Masked Diffusion Language Models
摘要
掩码扩散语言模型可以通过在每次去噪迭代中显示多个标记来减少推理步骤,但这种并行性很脆弱:当它们的预测耦合时,单独置信的位置可能不安全地一起提交。现有的 无需训练 采样器(例如 Top-\(k\)、Fast-dLLM 和 EB-Sampler)主要控制要显示的标记数量,同时通常按标记分数对候选对象进行排名,而忽略所选集合内的交互。我们提出了 ADAS,一种 无需训练 重新排序规则,该规则保持基本采样器的停止规则不变,并根据其对已选择位置的注意力(通过其预测不确定性进行加权)贪婪地折扣每个标记置信度得分。在推理基准 GSM8K 和 MATH500 以及代码基准 HumanEval 和 MBPP 上的 LLaDA-8B-Base 和 Dream-7B-Base 中,将 ADAS 插入所有三个采样器中,匹配降噪器评估的低 NFE 性能平均分别提高了 \(9.11\) 和 \(10.46\) 个百分点,每转发运行时开销为 \(3.1\%\)。代码可在 https://github.com/yusufsahin99/ADAS 获取。