论文

贪婪坐标扩散:通过扩散指导进行有效且语义一致的对抗性攻击

Greedy Coordinate Diffusion: Effective and Semantically Coherent Adversarial Attacks via Diffusion Guidance

模型评测安全与风险评测

摘要

尽管进行了广泛的研究,但对 大语言模型 的对抗性攻击的实际影响仍然有限。基于优化的攻击,例如贪婪坐标梯度 (GCG)(Zou 等人,2023)会产生高度复杂、不连贯的后缀,现有防御很容易检测到(Bengio 等人,2024)。此外,尝试在优化期间强制执行一致性约束通常会阻止攻击成功引发特定的目标响应,从而导致针对稳健模型的成功率较低。相反,保持一致性的攻击通常会改变查询的语义意图;当模型符合这些改变的查询时,响应无法解决对手的原始目标。在这项工作中,我们引入了贪婪坐标扩散(GCD),这是一种新颖的框架,可以有效地生成针对安全模型的对抗性攻击,同时保持对对手原始意图的低困惑度和高语义依从性。 GCD 利用离散扩散语言模型的生成先验来指导搜索对抗性后缀,以实现语义连贯性和一致性。与 GCG 不同,GCD 不需要直接梯度访问,因此可以在灰盒设置中运行。我们表明,GCD 实现了最高的 ASR,同时在响应质量分数上保持竞争力,并且基于困惑和防护模型过滤器构建的对抗性提示的检测率低于其他方法。