论文
寄存器移位破坏 LLM 安全:具有文化根源危害的孟加拉基准
Register Shifts Break LLM Safety: A Bengali Benchmark with Culturally Grounded Harms
摘要
孟加拉语是全球第七大语言,但 LLM 安全评估仍然绝大多数以英语为中心。我们推出了 BanglaSafe,这是 879 个孟加拉语提示的基准,结合了 309 个本地编写的提示和 570 个专家评审的提示,涵盖 17 个基于文化的伤害类别和 5 个因语言、写作风格和权威框架而异的提示条件。通过评估 18 个前沿 LLM,我们发现超过一半的回复是不安全或部分不安全的 (53.6%),而 14.7% 的回复包含严格有害的内容,并且观察到的最强烈的影响不是从英语到孟加拉语的转换,而是孟加拉语写作风格的选择:以正式报纸调查的方式表达的相同有害请求比以随意消息表达的相同请求成功率高 17 个百分点,没有对抗性涉及工程。我们进一步表明,现有的安全分类器很难可靠地评估孟加拉语内容,甚至前沿模型在近一半的情况下都失败了。