论文

一次越狱,多种语言:学习语言不敏感的意图表示以进行多语言越狱检测

One Jailbreak, Many Tongues: Learning Language-Insensitive Intention Representations for Multilingual Jailbreak Detection

AI 基础设施模型评测AI安全与内容治理基础设施安全与风险评测

摘要

大语言模型(LLM)越来越多地部署在全球多语言用户的应用程序中,但安全训练仍然集中在主流语言上,并没有与多语言能力同步发展,为越狱攻击创造了可利用的漏洞。目前的越狱防御措施主要是用主流语言开发和评估的,其有效性受到缺乏一致的多语言监督和语言变异导致的表示分散的限制。为了解决这个问题,我们提出了 MLJailDe,一种多语言越狱检测框架,旨在提高多语言鲁棒性和跨语言泛化能力。 MLJailDe 首先引入了多语言反向翻译数据增强算法,以构建跨 11 种语言的语义一致且功能有效的数据集,其中包含 2,232 个良性样本和 1,239 个越狱样本。在此基础上,MLJailDe采用相对距离约束来减少跨语言表示分散,并鼓励具有相似意图的越狱提示以形成跨语言一致的集群,同时进一步使用不平衡感知分类目标来缓解类别不平衡并学习更可靠的多语言决策边界。实验结果表明,MLJailDe 在多种语言上均优于最先进的基线,取得了 98.5% 的 F1 分数,并且在未见过的语言上获得了 97.1% 的平均 F1 分数,展示了强大的有效性和跨语言泛化能力。