论文
PAST2HARM:用于越狱多模态 AI 的简单自适应过去时攻击
PAST2HARM: A Simple Adaptive Past Tense Attack for Jailbreaking Multimodal AI
摘要
尽管不安全的图像生成可能比不安全的文本产生更严重的后果,而且当前的防御措施相对不成熟,但对多模式人工智能系统的越狱攻击仍未得到充分研究。我们引入了 PAST2HARM,这是一个简单而有效的自适应越狱框架,可以绕过最先进的多模态文本到图像模型中的拒绝训练。基于过去时态重新表述可以逃避保障措施的先前发现,PAST2HARM 系统地利用了多模态生成人工智能中的这一漏洞。我们从两个维度来描述攻击。首先,广度:通过时间深化,该框架逐渐加强历史锚定和档案线索,侵蚀具有不同对齐强度的模型之间的拒绝边界。其次,深度:通过初始合规后的迭代升级,我们探测有害生成的上限,使用由充当法官的语言模型评估的标量严重性越狱指标来测量严重性。我们发现,谈话中间会形成脆弱性峰值窗口,其中危害性会增加,然后趋于稳定并最终经历语义倒置。我们在 Gemini Nano Banana Pro、GPT Image 2 和 SD XL 三种模型上评估 PAST2HARM,在黑盒、无梯度设置中实现了 83%、67% 和 100% 的攻击成功率。对抗性提示也会跨模型转移,跨模型成功率超过 50%。这次攻击引发了各种有害输出,包括露骨的性内容、政治虚假信息、否认历史的叙述、仇恨言论和自残美化。我们进一步发布了提示、重新制定和输出的策划基准,作为红队和协调的资源。我们的结果暴露了当前保障措施的根本脆弱性,并强调需要加强多模式安全训练。