论文
IndicSafeEval:大语言模型在多语言说服性越狱攻击下的安全鲁棒性
IndicSafeEval: Safety Robustness of Large Language Models under Multilingual Persuasive Jailbreak Attacks
摘要
大语言模型 (LLM) 越来越多地在多语言环境中使用,但其安全性仍主要以英语进行评估。这限制了我们对对齐失败如何在资源匮乏和文化多元化的语言中表现出来的理解。我们介绍 IndicSafeEval,一个基于说服的印度语言越狱评估框架。我们的基准测试将十个安全关键内容类别与四种不同印度语言(例如印地语、孟加拉语、马拉地语和旁遮普语)的六种类人说服策略结合起来,产生了 7,200 个对抗性提示。我们对几个开源 LLM 进行了系统的黑盒评估,以检查它们的安全行为在不同语言、说服策略和风险类别之间的差异。我们的分析表明,该模型在所有语言和提示样式中的行为并不同样安全。相反,安全性能在很大程度上取决于所使用的语言以及使用有说服力的提示来表达请求的方式。我们进一步观察到,不同的风险类别表现出不同程度的脆弱性,某些类型的有害内容比其他内容更容易受到基于说服的越狱的影响。这些发现揭示了当前安全评估的重要局限性(主要以英语为中心),并强调需要多语言和有说服力的基准测试框架,以更准确地评估现实世界的 LLM 安全性。我们的实现可在 https://github.com/MonSaikat/IndicSafeEval 上找到。警告:本文包含可能令人反感或有害的示例数据。