论文
Schützen:评估保加利亚和德国背景下的 LLM 安全性
Schützen: Evaluating LLM Safety in Bulgarian and German Contexts
摘要
大语言模型 越来越多地部署在专业领域,带来难以预测的风险,包括生成有害或不尊重的内容。尽管在开发安全评估数据集方面取得了实质性进展,但现有资源仍然绝大多数以英语和中文为中心。当评估在共同的社会文化、法律和道德背景下运作的语言时,这种局限性尤其明显。为了解决这一差距,我们引入了 Schützen:一个德国-保加利亚安全数据集,旨在评估风险下的模型可回答性,涵盖低资源语言(保加利亚语)和高资源语言(德语)。多语言和特定语言 LLM 的实验揭示了安全行为中明显的跨语言差异,强调了定制、针对特定地区的评估资源的必要性,以支持 LLM 在德国和保加利亚的负责任部署。数据集和代码可在 https://github.com/xnlp-lab/Schutzen 获取。警告:本文包含可能具有冒犯性、有害性或偏见的示例。