论文

扩散语言模型中安全生成的自适应引导和重新屏蔽

Adaptive Steering and Remasking for Safe Generation in Diffusion Language Models

模型推理解码与生成控制

摘要

扩散语言模型(DLM)通过迭代去噪和双向生成为自回归语言模型提供了一种有前景的替代方案。然而,它们的迭代生成过程引入了明显的安全漏洞,因为有害内容可能出现在任意位置并在后续的去噪步骤中持续存在。现有的防御依赖于固定干预或积极的重新掩蔽,这限制了对降噪轨迹的自适应控制,并可能降低生成质量。我们提出了一种推理时间防御框架,它将自适应安全转向与安全感知重新屏蔽相结合。我们的方法使用选通方向从当前去噪状态不断调整转向强度,并将转向方向应用于屏蔽位置,以指导后续预测走向更安全的轨迹。我们的方法在第一代块之后进一步采用轻量级响应检测器,以在早期阶段识别不安全的轨迹。检测器触发对生成的内容和部分调节提示进行有针对性的重新屏蔽,并且模型在自适应安全转向下重新生成选定的位置。该设计将连续轨迹控制与不安全内容的显式修正相结合,同时无需修改模型参数。 LLaDA 和 Dream 上的实验表明,我们的方法提高了针对各种越狱攻击的鲁棒性,同时保持良性的生成质量和通用模型能力。我们的代码可在 https://anonymous.4open.science/r/DLM_Steering-C32B/ 获取。