论文
MultiBreak:用于评估 LLM 安全性的可扩展且多样化的多轮越狱基准
MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety
摘要
我们推出了 MultiBreak,这是一个可扩展且多样化的多轮越狱基准测试,用于评估 大语言模型 (LLM) 的安全性。多轮越狱模仿自然对话设置,使其比单轮越狱更容易绕过安全对齐的 LLM。现有的多轮基准测试规模有限或严重依赖模板,这限制了其多样性。为了解决这一差距,我们统一了各种有害的越狱意图,并引入了一个主动学习管道来扩展高质量的多轮对抗提示,其中生成器在基于不确定性的细化的指导下进行迭代微调以产生更强的攻击候选者。我们的 MultiBreak 包括 10,389 个多回合对抗性提示,涵盖 2,665 个不同的有害意图,并涵盖迄今为止最多样化的主题集。实证评估表明,我们的基准测试在 DeepSeek-R1-7B 和 GPT-4.1-mini 上的攻击成功率 (ASR) 分别比第二好的数据集高出 54.0 和 34.6。更重要的是,安全评估表明,不同的攻击类别揭示了细粒度的 LLM 漏洞},而在单回合下看似良性的类别可以在多回合场景中表现出更高的对抗有效性。这些发现突出了 LLM 在现实对抗环境下的持续漏洞,并将 MultiBreak 确立为可扩展的资源,以提高 LLM 的安全性。