论文

后门掩蔽扩散语言模型

Backdooring Masked Diffusion Language Models

模型评测安全与风险评测

摘要

掩码扩散语言模型(MDLM)正在成为一种引人注目的文本生成新范式,但其训练时的安全性在很大程度上仍未得到探索。现有的针对高斯扩散模型或自回归语言模型的后门攻击并不直接适用于 MDLM,因为 MDLM 依赖于离散状态损坏和迭代去噪,而不是连续噪声或从左到右的预测。在这项工作中,我们首次系统地研究了 MDLM 的训练时后门攻击。我们提出了 SHADOWMASK,这是一种后门攻击,通过用触发掩码混合先验替换标准的全掩码终端分布来修改 MDLM 前向损坏过程。这创建了一条从触发器损坏状态到攻击者指定目标的专用去噪路径,同时保留干净的去噪行为。我们通过定义后门前向过程、推导逆时后验并获得连续时间训练目标,进一步提供了原则性的数学公式。对 WikiText-103、OpenWebText 和 Alpaca 中基于 DiT 的 MDLM 和 LLaDA-8B-Instruct 的评估表明,SHADOWMASK 实现了近 100% 的攻击成功,大大优于标准数据中毒,很大程度上保留了干净的效用,在全模型和参数高效的 微调 下仍然有效,并且对代表性防御具有鲁棒性。