论文
HaloGuard 1.0:用于多语言人工智能安全的开放权重宪法分类器
HaloGuard 1.0: An Open Weights Constitutional Classifier for Multilingual AI Safety
摘要
我们提出了 HaloGuard 1.0,这是一种用于输入安全的宪法分类器范式的开放权重实现。它在英语和多语言即时安全基准测试中实现了最先进的性能,而模型大小约为当前领先的开放式防护模型的十分之一。安全构成是语料库的组织结构:由 46 项政策和 2,940 个子类别组成的自然语言构成驱动合成数据生成,具有详尽的一对一配对反事实,在翻转意图时固定主题和词汇,分别针对边界和基线误报 (FP) 的两层无害设计,以及跨 46 种语言的平衡多语言具体化,将语言视为出现在边界两侧的表面形式,而不是作为一种语言敌对信号。在七个即时安全基准测试中,HaloGuard 1.0-0.8B 在我们评估的所有开放防护中获得了最佳平均 F1 (90.9),在高达 27B 参数(大 30 倍以上)的情况下优于基线,同时将假阳性率 (FPR) 保持在 4.3,假阴性率 (FNR) 保持在 9.5。 HaloGuard 1.0-4B 变体的平均 F1 为 92.1,FPR 为 3.5,将其额外容量用于精度而不是召回率。对其余故障的结构化裁决表明,最明显的遗漏伤害案例是基准错误标签,而不是真正的模型遗漏。始终在线的对抗性红队协议不断强化对内容级攻击和代理攻击的防御。我们将模型作为开放权重发布。