论文
没有安全剂量:训练数据如何驱动不安全的图像生成
No Safe Dose: How Training Data Drives Unsafe Image Generation
摘要
在大规模数据上训练的文本到图像模型通常不可避免地会摄入不安全的内容。尽管有些人观察到输入输出放大,但仍不清楚训练数据组合是否以及如何直接驱动模型输出安全性或通过其他因素驱动。我们通过隔离这个变量来阐明这个问题:我们在多个数据集规模(100K 到 8M)的不安全图像比例(0\% 到 9.6\%)上不同的数据集上训练相同的文本到图像模型。然后,我们使用生成的模型生成图像,并使用四个独立的安全分类器对其进行评估。输出不安全性从 0\% 污染时的 16.6\% 单调上升到 5\% 污染时的 25.5\%。因子设计表明,不安全训练图像的\emph{比例}(而不是绝对数量)是有效变量。零污染时 16.6\% 不可约基线涉及其他成分,例如冻结文本编码器,作为残余安全风险——通过文本编码器消融证实,表明 SafeCLIP 将这一下限降低至 9.6%,而剂量反应效应在所有三个测试的编码器中仍然存在。至关重要的是,安全过滤不会导致 FID、CLIPscore 和 ImageReward 方面的质量下降。这些结果表明,数据管理和文本编码器安全是互补且独立有效的干预措施。与此同时,剩余的不安全程度对未来关于新兴能力和组合性的研究提出了问题。