论文
安全对齐的幻象:LLM的跨语言安全鸿沟
Safety Alignment Illusion: The Cross-Lingual Safety Gap in LLMs
摘要
当前针对大语言模型(LLM)的安全对齐训练高度以英语为中心。当这类安全过滤器对非英语语言失效时,后果直接且影响用户:语音助手和口语对话系统可能产出强化刻板印象的内容,绕过以英语为中心的标准安全对齐,并将有害偏见传播给非英语社区。对于部署在印度语言多元人群中的口语技术而言,这是一种关键的失效模式。为弥合这一跨语言鸿沟,我们提出INCLUDE(Indian Cultural Lens for Understanding and Detecting Embedded Biases),一个旨在量化以印度为中心的社会文化偏见的多语言评估基准。INCLUDE包含2604条提示,覆盖六种提示语言:英语、印地语、孟加拉语、马拉地语、泰米尔语和印英混合语(Hinglish)。我们用该基准评估了十个开源与闭源LLM,分析了14988个偏见分数。统计结果揭示两个关键发现:其一,孟加拉语在开源模型中产生最高的平均偏见分数;其二,英语出现显著反转——它在开源模型中偏见最低,却在闭源模型中偏见最高。
