论文

通过语义密码本进行跨语言越狱检测

Cross-Lingual Jailbreak Detection via Semantic Codebooks

AI 基础设施模型评测AI安全与内容治理基础设施安全与风险评测

摘要

大语言模型 (LLM) 的安全机制仍然主要以英语为中心,在多语言部署中造成系统漏洞。先前的研究表明,将恶意提示翻译成其他语言可以大大提高越狱成功率,从而暴露出结构性的跨语言安全漏洞。我们研究是否可以通过与语言无关的语义相似性来减轻此类攻击,而无需重新训练或特定于语言的适应。我们的方法将多语言查询嵌入与越狱提示的固定英文密码本进行比较,作为黑盒 LLM 的 无需训练 外部护栏运行。我们对四种语言、两种翻译管道、四种安全基准、三种嵌入模型和三个目标 LLM(Qwen、Llama、GPT-3.5)进行了系统评估。我们的结果揭示了两种不同的跨语言迁移机制。在包含规范越狱模板的策划基准上,语义相似性可以可靠地跨语言推广,实现近乎完美的可分离性(AUC 高达 0.99),并在严格的低误报约束下大幅降低绝对攻击成功率。然而,在分布变化下 - 在行为多样化和异构的不安全基准上 - 可分离性显着下降(AUC $\approx$ 0.60-0.70),并且所有嵌入模型中安全关键的低 FPR 机制中的召回率都会下降。