论文

BabelSafe:基于政策的 LLM 多语言安全基准

BabelSafe: A Policy-Grounded Multilingual Safety Benchmark for LLMs

模型评测安全与风险评测

摘要

随着 大语言模型 (LLM) 越来越多地部署在跨语言环境中,确保跨不同监管和文化环境的安全已成为一项关键挑战。然而,现有的多语言基准在很大程度上依赖于一般风险分类法和机器翻译的数据,限制了对预定义风险类别的评估,并且对特定地区的监管要求和文化背景的覆盖范围不足。为了弥补这些差距,我们推出了 BabelSafe,这是一个基于政策的多语言安全基准,涵盖 13 种语言设置。 BabelSafe 由区域监管来源构建,从特定司法管辖区的监管文件中提取风险类别和细粒度规则,直接用于指导多语言安全数据的生成。在数据生成过程中,我们进一步融入特定地区的文化背景,从而实现基于法规和文化背景的跨语言评估。在 BabelSafe 的基础上,我们开发了 BabelGuard,这是一种基于 Diffusion 大语言模型 (dLLM) 的护栏模型,支持多语言安全判断和策略条件安全评估。 BabelGuard 有两个变体,一个是用于快速“安全/不安全”分类的轻量级 1.5B 模型,另一个是功能更强大的 7B 模型,用于可定制的策略条件安全检查并提供详细说明。我们根据 6 个现有多语言安全基准和 BabelSafe 的 11 个强大护栏基线对 BabelGuard 进行了评估,展示了 BabelGuard 在这些评估设置中的强大性能。我们希望 BabelSafe 和 BabelGuard 能够帮助推进具有法规意识和文化背景的多语言护栏系统的开发。