论文

超越词元位置:扩散语言模型中去噪步骤的安全对齐

Beyond Token Positions: Safety Alignment Across Denoising Steps in Diffusion Language Models

模型推理解码与生成控制

摘要

Diffusion 大语言模型 (dLLM) 通过迭代去噪而不是从左到右解码来生成文本。这种生成范式引入了两个可以影响安全对齐的轴:去噪期间生成词元的时间以及它们出现在响应中的位置。在本文中,我们通过跟踪去噪过程中的中间词元分布和承诺决策来衡量有害提示下的 dLLM 安全行为。我们的分析表明,拒绝信号集中在早期的去噪步骤和领先的响应位置,并且早期提交的词元可以强烈影响最终的安全结果。我们的测量进一步表明,去噪步骤和拒绝词元承诺的持久性对于理解 dLLM 安全性非常重要。基于这些发现,我们提出了拒绝感知早期承诺(RAEC),这是一种简单的 无需训练 解码方法,可从早期步骤提交持久的拒绝信号。 LLaDA 和 Dream 上的实验表明,RAEC 降低了攻击成功率,同时很大程度上保留了实用性。该代码可在 https://github.com/Glresearch1/RAEC 获取。