Diffusion LLM 作为目标和对手:机械安全漏洞
Diffusion LLMs as Targets and Adversaries: Mechanistic Safety Exploits
摘要
扩散 大语言模型 (DLLM) 用迭代并行去噪取代了自回归下一个标记预测,但其内部安全机制仍然知之甚少。在这项工作中,我们将 DLLM 作为目标和对手进行研究,揭示了基于扩散的对齐中的机械漏洞。我们首先证明 DLLM 中的安全对齐仍然稀疏并且可以跨架构转移。从自回归前辈初始化的 DLLM 继承了与其源模型相同的机械安全足迹,从而可以通过直接安全神经元映射和修剪来实现传输攻击。自剪枝将 LLaDA 上的攻击成功率 (ASR) 从 2.6% 提高到 73.8%,在 Dream 上从 1.9% 提高到 86.6%,而 Qwen2.5 的传输剪枝将 Dream 上的 ASR 从 1.9% 提高到 73.2%,在 Fast-dLLM 上从 7.0% 提高到 86.3%。基于这些发现,我们引入了 SN-Guided Diffusion,这是一个完全离线的黑盒越狱框架,它使用加权安全神经元损失来引导扩散过程远离安全触发区域,从而实现近乎完美的即时可分离性(良性与越狱区分的 AUROC = 1.0)。在多个开放和专有目标上,我们的方法在 Llama-3-8B-Instruct 上实现了高达 77.1% 的传输 ASR,在 Qwen2.5-7B-Instruct 上实现了高达 86.9%,在 Gemini-2.5-Flash-Lite 上实现了 74.3%,而每个提示只需要 20 代剧集。与之前的越狱框架相比,我们的方法实现了有竞争力的可转移性,并且生成成本降低了几个数量级。我们的代码库位于 https://github.com/ellyoana/sn-guided-diffusion。