论文
硬否定揭示了简单否定隐藏的内容:跨语言危害性表征随着硬否定下的资源层而降低
Hard Negatives Reveal What Easy Negatives Hide: Cross-Lingual Harmfulness Representations Degrade with Resource Tier Under Hard Negatives
摘要
大型语言模型中的安全对齐主要是用英语进行训练的,最近的工作报告表明,潜在的危害性表示在翻译中仍然存在:经过英语训练的探针在低资源语言中几乎与英语一样能够将有害提示与无害提示区分开来。这被认为是跨语言拒绝失败主要反映的是校准而不是表征质量的证据。我们证明这个结论取决于反面例子的选择。在跨越三个资源层的九种语言中,当无害的提示来自不相关的分布(简单的负数)时,我们复制了近乎完美的传输(AUROC > 0.98)。 XSTest 对比提示是良性的,但表面上与有害请求(硬负数)类似,在低资源语言中传输会崩溃,而在高资源语言中则基本保持稳定。在 Qwen2.5-7B-Instruct 上,平均 AUROC 下降从英语的 0.003 增加到高资源语言的 0.017、中等资源的 0.042 和低资源语言的 0.276。该图案在 Aya Expanse 上复制。反向翻译 chrF 控制和跨三种语言的匹配 chrF 比较降低了翻译质量解释效果的可能性。控制 chrF 后,崩溃仍然存在(部分 r = 0.70,p = 0.03)。分词器的生育力与崩溃相关,并解释了部分资源层效应,但不是全部。结果表明,易负片迁移可以与硬负片下的显着退化共存。因此,仅简单否定评价并不能确定有害性表征在翻译后仍然存在。