论文

Nemotron 3.5 Content Safety Moderator:支持多模态、多语言和推理的紧凑内容安全审核模型

Nemotron 3.5 Content Safety Moderator: A Compact Multimodal, Multilingual, and Reasoning Enabled Content Safety Moderator

模型优化小模型/轻量模型

摘要

已部署的人工智能应用程序的安全审核正在超越纯文本提示:系统越来越需要根据跨领域不同的策略来判断图像、文档、屏幕截图和生成的响应。现有的护栏通常仅覆盖此设置的一部分,因此很难将广泛的覆盖范围、自定义策略控制和低计算成本结合起来。我们推出了 Nemotron 3.5 内容安全审核器(为简洁起见,在本文中也称为 Nemotron 3.5 CS),这是一种紧凑的 4B 视觉语言安全审核器,可对 12 种语言的用户提示、图像和助理响应进行联合分类。 Nemotron 3.5 CS 返回用于延迟敏感审核的安全标签,并且还可以生成简洁的推理跟踪,这些跟踪应用提供的自定义策略并在请求推理时识别违规类别。我们还发布了用于警卫训练的多模态和多语言安全数据集,涵盖人工标记的真实图像审核、良性视觉语言和文档任务、合成罕见风险和越狱案例以及自定义策略示例。在涵盖多模态安全性、文本审核、多语言鲁棒性、自定义策略遵循、良性误报和延迟等方面的评估中,Nemotron 3.5 CS 展示了实际的覆盖权衡:它增加了图像调节和策略调节的审核,同时与专门的防护模型保持广泛的竞争力。这些结果表明,紧凑的视觉语言调节器可以作为可部署的一线安全组件,并选择性地用于审计和政策审查。