论文

ContextualJailbreak:通过模拟对话启动进行进化红队

ContextualJailbreak: Evolutionary Red-Teaming via Simulated Conversational Priming

模型评测安全与风险评测

摘要

大语言模型 (LLM) 仍然容易受到越狱攻击,这些攻击会绕过安全调整并引发有害响应。越来越多的工作表明,上下文启动(早期的转向隐性偏见后来的回复)构成了强大的攻击面,手工制作的多轮支架在有能力的模型上始终优于单轮操作。然而,基于自动优化的红队在很大程度上仍然局限于单轮设置,迭代静态提示,并且缺乏推理哪种形式的对话启动会引起服从的能力。虽然最近的多轮、基于搜索的方法已经开始弥合这一差距,但有效引发对话背后的突变设计空间在很大程度上仍未被探索。我们提出了 ContextualJailbreak,这是一种黑盒红队策略,可在模拟的多轮启动对话上执行进化搜索。该策略利用二级法官的 0-5 级伤害评分作为循环信号,使部分有害的响应能够指导搜索过程而不是被丢弃。搜索由五个语义定义的变异算子驱动:角色扮演、场景、扩展、故障排除和机械,其中最后两个是这项工作的新颖贡献。在 50 个有代表性的 HarmBench 行为中,ContextualJailbreak 在 gpt-oss:20B 上实现了 100% 的 ASR,在 qwen3-8B 上实现了 100%,在 llama3.1:70B 上实现了 100%,在 gpt-oss:120B 上实现了 90%,平均优于四个单轮和多轮基线 31-96 个百分点。针对 gpt-oss:120B 传输发现的 40 个最大危害攻击,未适应封闭边界模型,在 gpt-4o-mini 上实现了 90.0%,在 gpt-5 上实现了 70.0%,在 Gemini-3-flash 上实现了 70.0%,但在 claude-opus-4-7 上仅实现了 17.5%,在 claude-sonnet-4-6 上实现了 15.0%,揭示了明显的缺陷。提供商级别的一致性鲁棒性不对称。