论文
EvoFlint:多轮 LLM 漏洞的进化图谱
EvoFlint: An Evolutionary Atlas of Multi-Turn LLM Vulnerabilities
摘要
拒绝有害单轮提示的前沿语言模型通常会在多次轮次逐渐达到相同意图时遵守,这使得多轮攻击成为 大语言模型 最不被理解的失败模式之一。大多数自动化红队方法将此视为生成问题:产生破坏模型的攻击。我们认为,最好将其构建为一个搜索问题:发现、组织和迭代地完善各种攻击策略档案,生成目标模型如何失败的结构化图,而不是一次性成功的列表。我们介绍 EvoFlint,它将进化质量多样性搜索应用于多轮红队。攻击策略是分阶段的对话计划,而不是原始提示,并且通过 LLM 驱动的突变和交叉而演变。对攻击成功率和峰值严重性的帕累托适应性保留了来自未遂攻击的选择信号。风险索引档案运行新颖性搜索,对每个单元内的策略描述嵌入进行本地竞争,保持多样性,而无需遵守预定义的样式分类法。一代级记忆积累了整个人群的目标模型洞察力,并将其反馈到策略生成中。在 HarmBench 测试中,EvoFlint 在 Claude Sonnet 4.6 上的攻击成功率为 35.8%,在 GPT-5.4 上的攻击成功率为 59.7%,在 Qwen3-32B 上的攻击成功率为 94.3%,而在作为基准参考的旧版 GPT-4o 上的攻击成功率为 98.7%。由此产生的档案按风险类别组织,揭示了每个目标的安全训练已涵盖和未涵盖的伤害类别。