论文
掩蔽扩散语言模型的集群级注意力引导并行解码
Cluster-Level Attention-Guided Parallel Decoding for Masked Diffusion Language Models
摘要
掩蔽扩散语言模型 (MDLM) 通过预测每个去噪步骤的所有掩蔽位置来实现并行解码,但现有的 无需训练 采样器通常决定以 词元级 粒度提交哪些位置。我们重新审视这种粒度,并观察到可靠的预测通常以连续的高置信度跨度出现,这表明并行承诺的单位可以大于单个词元。我们首先将相邻的高置信度候选者分组为置信诱导簇(CIC)作为跨度更新单元。然后,我们使用来自同一前向传递的自注意力图来估计集群间依赖关系,从而能够对相互兼容的 CIC 进行冲突感知选择以进行并行提交。这产生了 CLAD(集群级注意力引导解码),这是一个用于 MDLM 的 无需训练 集群级解码器。在四个推理和代码生成基准测试中对 LLaDA 和 Dream 模型系列进行的实验表明,CLAD 比 Vanilla 解码实现了 1.77 倍--8.47 倍的加速,同时在大多数设置中保持了大致可比的任务准确性。