论文

SafeAtlas-VL:借助大规模数据和防护模型超越二元多模态安全判断

SafeAtlas-VL: Beyond Binary Multimodal Safety with Large-Scale Data and Guard Models

模型训练合成数据

摘要

多模态安全调节需要区分视觉内容、用户意图和助理行为产生的风险。然而,现有的防护措施通常是针对单一判断目标进行训练,并将安全评估简化为二元决策。因此,在多模态交互中比较风险变得困难,并且模糊的情况被掩盖。我们引入了 SafeAtlas-VL,这是一个包含 150 万个训练实例的数据集,它将图像、请求和响应级别的判断置于五级有序尺度上。我们从现实世界和合成来源收集了大量与安全相关的数据,并应用了分歧感知注释程序。生成的数据集涵盖 15 个危害类别和 55 个细粒度子类别,涵盖广泛的多模态安全场景。我们还构建了 SafeAtlas-Bench,这是一组包含 5,000 个实例的保留集,用于评估五级预测和连续风险评分。在此数据集上,我们通过目标条件调整来训练 SafeAtlas Guard 系列模型,以进行多模态安全检测。我们的模型不仅执行安全级别的五向分类,还通过软累积序数头将安全性映射到连续分数。实验结果表明,在我们的数据集上训练的警卫模型表现出很强的泛化性:即使不使用其他基准的训练集,它们在相应的测试集上也能实现有竞争力的性能。值得注意的是,我们的 8B 模型获得了整体最佳性能,在 F1 分数中比之前的 SOTA 提高了约 4%。发布代码、数据和模型以支持进一步的研究。警告:本文包含可能具有攻击性、有害性、图形性或令人不安的示例数据。

SafeAtlas-VL:借助大规模数据和防护模型超越二元多模态安全判断:论文配图
图1 安全地层-VL警卫和安全地层警卫队概况。