结构性越狱普遍化但不复合:非自愿情境学习的跨提供商和多语言研究
Structural Jailbreaks Generalize but Do Not Compound: A cross-provider and multilingual study of Involuntary In-Context Learning
摘要
对齐的语言模型在两个独立的压力下失败:结构越狱类最近正式命名为非自愿上下文学习(IICL),它将有害请求重新定义为通过模式完成的数据标记任务的最终缺失单元,而不是判断为内容;以及英语之外的安全一致性的侵蚀。一个自然的假设是这些化合物。我们直接测试一下。使用确定性 IICL 算子和 StrongREJECT 式的评估规则,我们在两个基准上对两个 Google Gemini 模型进行了红队测试,分别是来自 HarmBench 的 30 种一般危害行为和来自 FinProof 的 30 种金融滥用行为,每种行为均在单次基线下,并在 IICL 下使用四种语言(英语、西班牙语、印地语、阿拉伯语)。首先,IICL 推广到第二个提供商,并且在金融方面更差:它在 HarmBench 上将攻击成功率从 <=6.7% 提高到 80-90%,在 FinProof 上提高到 97-100%,比其在 OpenAI 的 GPT-5.4 上报告的介绍研究报告的 <=24% 高出一个数量级。其次,与假设相反,强制 IICL 输出为非英语语言并不会叠加这两个弱点,而是会削弱攻击。 12 种非英语条件中有 11 种的得分低于英语基线(符号测试,p~0.003),唯一的例外是上限接近 100%;在更强的模型的财务设置上,阿拉伯语从 100% 崩溃到 33%。我们将其归因于相关性诅咒:一旦结构解锁了合规性,模型就会以低资源语言产生低质量的有害内容,物质评级法官将其评分为部分。该模式在独立的非 Google 法官的指导下进行了复制(Cohen 的 kappa=0.86,377 个配对判决),并且 76.6% 的非英语回复经过了语言验证。因此越狱漏洞不是累加的;主要的剩余风险是英语结构性攻击,其中最严重的是金融滥用,而不是多语言攻击。