论文
SAFEGuard:通过有害的语义分析和流畅性测量来检测基于优化的越狱攻击
SAFEGuard: Detect Optimization-Based Jailbreak Attacks Through Harmful Semantic Analysis and Fluency Measurement
摘要
尽管为使 大语言模型 (LLM) 与人类价值观保持一致并确保安全部署付出了巨大努力,但最近的研究表明,LLM 仍然容易受到对抗性越狱攻击,这些攻击可以绕过安全护栏并引发有害响应。人们提出了许多防御方法来检测越狱,但它们在对抗基于大范围优化的越狱机制方面的有效性有限,这些越狱机制可能会产生高度流畅性优化或有害的语义模糊提示。为了应对这一挑战,我们提出了一个统一的检测框架SAFEGuard,它结合了基于跨层分布距离和困惑度的混合流畅性测量,以及通过梯度匹配分析有害语义。我们的方法基于一个最重要的观察:高流畅性提示保持其恶意意图接近有害提示,而有害语义混淆提示通常会注入乱码标记序列。我们的评估表明,SAFEGuard 始终优于最先进的基准,并在不同基于优化的越狱中实现了准确性的显着提高。这强调了 SAFEGuard 针对不断演变的越狱攻击的有效性。