论文

RISE:通过现代文本到图像模型的迭代策略演进进行红队合作

RISE: Red-teaming via Iterative Strategy Evolution for Modern Text-to-Image Models

模型评测安全与风险评测

摘要

在现代生产文本到图像系统中,成功的策略违规很少见,并且以前有效的人工编写的种子通常会被修补。当前的自动化红队人员在两个方面与该制度不匹配:不可靠的成功衡量和糟糕的探索。首先,我们发现,在之前的 T2I 红队工作中广泛使用的评审在模糊的不安全内容目标下是不可靠的:他们要么错过真正的违规行为,要么奖励硬化 API 上的良性边界图像。因此,我们定义了严格的特定类别成功标准,并根据人类标签校准强大的 VLM 判断。其次,我们表明广泛使用的提示修改管道并不能解决探索问题:在更严格的护栏设置上,它们仍然与种子提示相关联,无法传输或无法引导正面示例。我们引入了RISE,它发展了用于生成提示的可重用策略,而不是一一重写它们。然后,重新使用发现的最佳策略来生成跨新场景的攻击。在 DALL-E 3、Nano Banana 2 (Google) 和 GPT-Image-2 上,RISE 达到经人工验证的高达 13% 的 ASR;在相同的校准评估下,之前报告的 ASR 高达大约 30% 的方法下降到接近于零。