论文

SurakshaEval:多语言的印度安全基准 LLM

SurakshaEval: An Indic Safety Benchmark for Multilingual LLMs

模型评测基准与评测资源

摘要

大语言模型 (LLM) 现有的安全评估数据集主要关注英语和西方语境,往往忽视其他语言中存在的语言多样性和文化安全风险。为了解决这一差距,我们推出了 SurakshaEval,这是一种新颖的安全基准,由跨越现实世界场景的人工编写提示组成,专门针对印度十种主要语言(阿萨姆语、孟加拉语、古吉拉特语、印地语、卡纳达语、马拉雅拉姆语、马拉地语、旁遮普语、泰米尔语和泰卢固语)以及英语而设计。 SurakshaEval 既包括印度常见的通用提示,也包括捕捉当地社会文化敏感性的特定地区和语言的提示。我们在 SurakshaEval 上对一系列最先进的 LLM 进行基准测试,建立基准安全性能,并识别重复出现的故障模式,包括过度拒绝、漏检隐性偏见以及区域敏感环境中的情境意识不足。我们的结果表明,即使是强大的多语言 LLM 在以印度语言(尤其是本机脚本)运行时也难以可靠地满足细致入微的安全要求。这些发现凸显了对安全评估框架的迫切需要,该框架纳入特定区域的数据和结构化评估协议,从而能够开发和部署安全、合乎道德且符合不同社会价值观的人工智能系统。我们的代码和数据可在 https://github.com/debobanerjee/SurakshaEval 获取。警告:本文包含可能具有攻击性或不安全的文本。