论文
单独安全,在一起不安全:良性图像组合时防止隐性毒性
Safe Alone, Unsafe Together: Safeguarding Against Implicit Toxicity When Benign Images Combine
摘要
多图像内容已成为社交媒体中日益流行的视觉传播形式,引发了一个新的安全问题,即多图像隐性毒性(MIIT),其中每个图像在孤立时看起来是良性的,但当图像被联合解释时就会出现有害的语义。由于每个图像中缺乏明确的风险提示,工信部对于现有的商业审核 API 和模型尤其具有挑战性。本文旨在研究如何识别工信部。我们首先提供工信部的正式定义,并分析其检测的三个关键挑战。为了缓解该领域数据的稀缺性,我们构建了 MIIT 数据集,这是一个通过自动生成管道涵盖七个代表性风险类别的纯图像多图像安全数据集。最后,我们通过逐步提炼的推理监督来训练 MiShield,使其能够产生安全判断,同时对导致危险的相关实体进行明确分析。实验表明,MiShield-8B 模型的性能优于代表性的审核服务甚至更大规模的模型,揭示了其对于这种广泛使用的视觉格式的有效性和实用价值。警告:本文包含潜在敏感内容。