论文

阿拉伯语安全联盟作为选择性拒绝:SFT、DPO 和 Guard 校准的实证研究

Arabic Safety Alignment as Selective Refusal: An Empirical Study of SFT, DPO, and Guard Calibration

模型评测安全与风险评测

摘要

阿拉伯语 大语言模型 必须拒绝有害提示,但不能过度拒绝良性或敏感提示,但单一拒绝率隐藏了这种权衡。我们使用良性拒绝 B 和有害提示拒绝 H 来评估它,其中 H 衡量的是拒绝而不是有害的依从性。在五个支持阿拉伯语的模型和完整的人工编写的 AraSafe 集上的 130 次运行中,仅拒绝监督的 微调 (SFT) 崩溃到全面拒绝,而选定的混合 SFT 配置在 B = 14% 到 23% 时达到 H = 90% 到 93%;四种选定的配置在所有三轮运行中都超过了 H = 90% 的目标,而 Fanar 在三轮运行中的两次都超过了 H = 90% 的目标。直接偏好优化 (DPO) 和推理防护在模型之间以不同方式更改 B 和 H,而不是充当统一升级。在盲法 300 回复审核中,注释者二元拒绝一致性为 89.0%(kappa = 0.78); Qwen3Guard 和 Aya Expanse 32B 的准确率分别达到 88.7% 和 91.0%,没有结论性的配对差异。 Selected SFT 在所有五个模型中都提高了arabizi 的 H 值,但没有一个达到 90%,仅显示出部分来自现代标准阿拉伯语的迁移。总体而言,结果支持特定于模型的操作点选择:设置部署目标并仅保留改进该目标的干预措施。