论文
扩散语言模型越狱的能量景观分析
Why Jailbreaks Succeed in Diffusion Language Models: An Energy Landscape Analysis
摘要
基于扩散的大语言模型 (dLLM) 的现有攻击和防御针对特定漏洞,但缺乏解释攻击成功原因的共享框架。我们提出了一种方法,将安全对齐解释为塑造去噪能量景观:一个对齐良好的模型通过分隔两个区域的能量屏障将有害查询路由到安全输出。当前的越狱攻击简化为两种规避此障碍的策略:在初始化时模糊查询的安全配置,或干预中间轨迹以强制降噪路径跨越能量障碍。从这个角度以及掩蔽扩散模型在去噪过程中最小化动能的结果,我们得出了三个互补的、免训练的检测信号:一个第0步比率,在生成开始之前从logit分布中读取初始安全配置,以及两个跟踪logit空间的互补子空间中的动能的轨迹速度信号。攻击必须要么在初始化时揭示其意图,要么消耗动能来穿过至少一个受监控子空间中的屏障,因此这三个信号通过构造覆盖了彼此在能量预算中的盲点。对三个密集 dLLM(LLaDA-8B、LLaDA-1.5、Dream-7B)和稀疏专家混合 dLLM (LLaDA-MoE-7B) 的评估证实了这种互补性。在已知攻击的压力测试中,每种逃避检测的配置也无法产生有害内容,这表明检测阈值和跨越障碍阈值很难分开。
