论文

Opir:针对毒性、越狱、仇恨言论和有害内容的高效多任务安全分类

Opir: Efficient Multi-Task Safety Classification for Toxicity, Jailbreaks, Hate Speech, and Harmful Content

AI 基础设施AI安全与内容治理基础设施

摘要

大语言模型 (LLM) 应用程序的实时安全过滤需要分类器能够检测不安全提示、有毒语言、越狱尝试和不安全响应,而无需大型护栏模型的成本配置,并且能够区分良性敏感文本和真正隐蔽的有害内容。在本文中,我们介绍 Opir,这是一系列基于 GLiClass 架构的基于编码器的护栏模型。 Opir 包括用于二元安全/不安全分类、多标签毒性分类、越狱分类以及零样本不安全提示和响应分类的多任务模型。我们还发布了专用于二进制安全/不安全分类的参数少于 100M 的边缘变体。这些模型接受三级分类法的训练,其中包含 16 个顶级标签、126 个中级标签和 854 个叶标签的 996 个类别。 Opir 的训练数据结合了基于分类学的不安全提示、对抗性挖掘的硬否定、良性安全保护示例、生成的响应示例、多语言翻译以及 Aegis2 和 WildGuard 训练子集的部分。我们还开源了一个评估工具,支持 GLiClass 和 GLiNER2 后端以及基于解码器的模型,涵盖了公共基准系列中的二进制安全分类、多标签分类、毒性、越狱检测、提示安全、响应安全、响应拒绝和提示子类别视图。通过针对 8 个当代护栏系统(包括基于 GLiNER2 的护栏模型和生成护栏模型)的 12 个安全分类任务和 17 个类别任务的扩展比较,Opir 变体在大多数基准数据集上的最强开放权重基线上具有竞争力或领先于大多数基准数据集,同时以更小的部署占用空间运行。