论文

低资源语言中跨语言安全的幻想

The Illusion of Cross-Lingual Safety in Low-Resource Languages

模型评测安全与风险评测

摘要

大语言模型 (LLM) 中的安全对齐主要是用英语开发的,假设这些安全措施适用于多语言环境。然而,这一假设仍未得到充分研究,并暴露了低资源语言中的漏洞。我们使用 LoDNA(一种新的安全数据集,将直译与文化本地化提示配对)研究了四种非洲语言(契维语、豪萨语、阿姆哈拉语和斯瓦希里语)的跨语言安全转移。为了超越基于生成的评估,我们提出了一个潜在的几何框架,用于探测 LLM 中的隐藏状态拒绝表示。我们的实验结果表明,跨语言安全传输受到严重限制;在大多数语言模型对中,有害提示仅保留不到 10% 的英语拒绝信号。文字和本地化提示在语义上是一致的(余弦 0.95-0.996),但跨层漂移,这表明模型对概念进行编码,而不将它们路由到安全机制。这些发现表明,当前的多语言安全一致性是肤浅的,提供了强有力的证据来反对在所研究的特定低资源语言中存在普遍的、与语言无关的危害多样性的假设。警告:本文包含可能令人反感或有害的示例数据。