论文
从权重检测 CSAM 文本到图像 LoRA
Detecting CSAM Text-to-Image LoRAs From Weights
摘要
低秩适应 (LoRA) 微调 可以廉价且轻松地为特定任务定制开放权重图像生成模型,包括儿童性虐待材料 (CSAM) 的制作。现有的审核依赖于元数据或生成的输出,但元数据可能具有欺骗性,并且生成的输出本身可能是不可接受或非法的。我们证明了更安全的信号存在于权重中。 LoRA 更新的左上角奇异向量形成其最强学习变化的紧凑、无推理指纹 ($u_1$)。使用人类受试者年龄作为 CSAM 的良性代理,我们发现 $u_1$ 确定了 LoRA 的训练内容,概括了基础模型,并放弃了不相关的良性内容。该信号对于附加权重噪声、重新缩放和精度降低具有鲁棒性。这些结果表明,可以直接根据权重筛选有害的 LoRA,而无需依赖元数据或生成有害的输出。