论文
对抗风格优化:通过基于 GRPO 的风格触发器优化增强 VLM 越狱
Adversarial Style Optimization: Enhancing VLM Jailbreaks by GRPO-based Stylistic Triggers Optimization
摘要
多模式 大语言模型 (MLLM) 已经取得了令人印象深刻的性能,但其安全性仍然容易受到越狱攻击。现有的基于内容的越狱通常不一致,并且针对快速发展的 MLLM 表现出令人不满意的性能,无法利用非基于内容的漏洞。与之前的研究不同,我们凭经验发现 MLLM 的理解能力和安全能力之间表现出风格上的不一致:无论视觉风格如何,MLLM 都可以稳健地理解内容,但它们的防御机制很容易被特定的风格触发因素绕过。基于这一发现,我们提出了对抗风格优化(ASO),这是一个即插即用的增强模块,用于放大现有的视觉越狱。 ASO 微调图像编辑模型,以将优化的风格修改叠加到给定的对抗性图像上,使用由结构分层奖励函数引导的组相对策略优化 (GRPO) 代理,该函数结合了用于检测明确拒绝的基于 logits 的信号与来自强大判断模型的高保真语义评估。大量实验表明,ASO 显着增强了 SOTA 攻击的 ASR,证明风格偏差是红队 MLLM 的可扩展向量。我们的代码可在 https://github.com/bingjunluo/ASO 获取。