论文
TreeTeaming:通过分层策略探索进行视觉语言模型的自主红队
TreeTeaming: Autonomous Red-Teaming of Vision-Language Models via Hierarchical Strategy Exploration
摘要
视觉语言模型(VLM)的快速发展使其安全漏洞成为人们关注的焦点。然而,现有的红队方法从根本上受到固有的线性探索范式的限制,将它们限制在预定义的策略集内进行优化,并阻止发现新颖的、多样化的漏洞利用。为了超越这一限制,我们引入了 TreeTeaming,这是一个自动化的红队框架,它将策略探索从静态测试重新构建为动态的、进化的发现过程。其核心是一个由 大语言模型 (LLM) 提供支持的战略编排器,它自主决定是否发展有前途的攻击路径或探索不同的战略分支,从而动态构建和扩展策略树。然后,多模式执行器的任务是执行这些复杂的策略。在 12 个著名 VLM 的实验中,TreeTeaming 在 11 个模型上实现了最先进的攻击成功率,优于现有方法,在 GPT-4o 上达到 87.60%。该框架还展示了比之前公开的越狱策略联合更优越的策略多样性。此外,生成的攻击平均毒性降低了 23.09%,展示了其隐蔽性和微妙性。我们的工作引入了一种自动漏洞发现的新范例,强调了超越静态启发式的主动探索的必要性,以确保前沿人工智能模型的安全。