论文

形式上一致,意义上不一致:低资源孟加拉贬义语音中 LLM 安全性的理解-遏制解耦

Aligned in Form, Not in Meaning: The Comprehension - Containment Decoupling of LLM Safety in Low-Resource Bangla Derogatory Speech

模型评测安全与风险评测

摘要

我们通过六个协议对孟加拉本地贬义语音 (gali) 的五个前沿 大语言模型 进行了审核,以测试一个假设:理解-遏制解耦。我们认为,当代安全对齐与高资源表面形式绑定,而不是有害含义,从而导致模型理解低资源诽谤的能力以及包含它独立运作的能力。每个协议都根据人类校准基线(kappa = 0.84)证实了这一假设。基线时,模型在孟加拉语中表现出 7.92 个百分点的理解缺陷,同时在两种语言中保持相同的 92.83% 标记泄漏率。严重性校准跟踪构成伤害的表面解剖线索(轻度俚语错误为+4.00;威胁为-2.00),而拼写扰动下的明显遏制增益被证明是标记器驱动的“遏制海市蜃楼”。至关重要的是,明确的思想链推理可以挽救理解(94.72% 通过),同时系统地拆除遏制(96.23% 使用)。此外,专家角色框架将拒绝率降至 6.57%,这表明基于关键字的过滤器完全忽略了非人性化的公共诽谤。我们的研究结果表明,高资源基准无法证明低资源安全性,因此需要基于意义的遏制。