论文

超越完全随机掩蔽:注意力引导的扩散语言模型去噪和优化

Beyond Fully Random Masking: Attention-Guided Denoising and Optimization for Diffusion Language Models

模型推理解码与生成控制

摘要

扩散 大语言模型 (dLLM) 通过并行解码为自回归模型提供了一种有效的替代方案,但现有的 后训练 方法在很大程度上依赖于随机屏蔽策略,而忽略了内在的标记依赖性。在这项工作中,我们对 dLLM 中的注意力进行了实证分析,并表明更强烈地关注未屏蔽上下文的词元表现出更大的生成稳定性,并在推理中发挥着关键作用。受这些发现的启发,我们提出了 AGDO,一种注意力引导的去噪和优化框架,它将训练和优化与注意力衍生的依赖关系结合起来。 AGDO 根据注意力结构确定去噪顺序,并在监督 微调 和强化学习期间强调注意力关键标记。数学和编码基准实验表明,AGDO 持续提高推理性能,优于 dLLM 最先进的 后训练 方法。