论文

盾星

Shieldstral

AI 基础设施AI安全与内容治理基础设施

摘要

我们推出了 Shieldstral,这是一种 3B 参数策略自适应多模式安全分类器,它在文本安全基准上匹配或优于其大小近 7 倍的模型,并在多模式安全分类方面树立了新的技术水平。 Shieldstral 将内容审核制定为二元问答任务。这种简单的表述将不同的审核任务统一为一个是/否问题,从而使具有不同分类法的异构安全数据集能够在一个训练框架下进行整合。我们提出了数据构建方案,涵盖约 5410 万个样本的管理和生成以及用于评估政策适应性的细粒度评估集。总之,这些使得小型自适应模型能够匹配或优于更大的模型。