论文
重新屏蔽和重定向:利用扩散语言模型中的去噪不可逆性
Re-Mask and Redirect: Exploiting Denoising Irreversibility in Diffusion Language Models
摘要
扩散语言模型(dLLM)中的安全对齐依赖于一个单一的承载假设:提交的词元是永久性的。我们证明,通过重新屏蔽已提交的拒绝词元并注入简短的肯定前缀,违反这一假设,在所有三个公开的安全调整 dLLM 上的 HarmBench 上实现了 74-82% 的 ASR,使用通用的 8 词元合规性前缀则上升至 92-98%。我们将这种攻击称为 TrajHijack;这是对 dLLM 的第一个轨迹级攻击,不需要梯度计算,并且可以推广到 SFT 和偏好优化 (VRPO) 模型。出现了三个发现。首先,该漏洞不可简化地由两个部分组成:单独重新屏蔽(4.4%)和单独前缀(5.7%)都失败。其次,通过可微分的 Gumbel-softmax 链进行梯度优化会持续降低 ASR(41.5% vs. 76.1%),因为连续的扰动将词元分布推离流形。第三,A2D(已发布的最强的 dLLM 防御)比无防御模型(76.1%)更容易受到 TrajHijack(89.9%)的影响:它的无声拒绝训练消除了轨迹级攻击必须克服的上下文阻力,我们将这种效应称为防御反转效应。