论文

使用低资源语言对LLM进行多语言越狱

Multilingual jailbreaking of LLMs using low-resource languages

模型评测安全与风险评测

摘要

大语言模型 (LLM) 仍然容易受到绕过安全护栏的越狱尝试的影响。我们研究使用资源匮乏的非洲语言(南非荷兰语、斯瓦希里语、isiXhosa 和 isiZulu)进行的多轮对话是否可以绕过商业 LLM 的安全机制。我们翻译了现有数据集的提示,并通过自动化测试和与母语人士的人工红队评估了 ChatGPT、Claude、DeepSeek、Gemini 和 Grok。单轮翻译攻击被证明是无效的,而多轮对话实现了英语有害响应率从 52.7% (Claude 3.5 Haiku) 到 83.6% (GPT-4o-mini),南非荷兰语从 60.0% (Claude 3.5 Haiku) 到 78.2% (GPT-4o-mini),斯瓦希里语从 41.8% (Claude 3.5 Haiku)至 70.9%(DeepSeek)。与自动化方法相比,人工红队提高了越狱率。在所有评估的语言中,平均越狱率从 59.8% 增加到 75.8%,提高了 +20.0%(南非荷兰语)、+12.7%(isiZulu)、+12.3%(isiXhosa)和 +1%(斯瓦希里语),这表明翻译质量差限制了越狱成功。这些发现表明,LLM 中的漏洞在多语言环境中仍然存在,并且翻译质量是决定低资源语言越狱成功的关键因素。