论文
AgenticRed:优化 Agentic 系统以实现自动化红队
AgenticRed: Optimizing Agentic Systems for Automated Red-teaming
摘要
虽然最近的自动化红队方法有望系统地暴露模型漏洞,但大多数现有方法依赖于人类指定的工作流程。这种对手动设计工作流程的依赖会受到人为偏见的影响,并且使得探索更广泛的设计空间变得昂贵。我们推出 AgenticRed,这是一种自动化管道,利用大语言模型的情境学习来迭代设计和完善红队系统,无需人工干预。 AgenticRed 不是在预定义结构内优化攻击者策略,而是将红队视为系统设计问题。受元代理搜索等方法的启发,我们开发了一种使用进化选择来进化代理系统的新颖程序,并将其应用于自动红队问题。 AgenticRed 设计的红队系统始终优于最先进的方法,在 HarmBench 上的 Llama-2-7B 上实现了 96% 的攻击成功率 (ASR)(提高了 36%),在 Llama-3-8B 上实现了 98% 的攻击成功率 (ASR)。我们的方法表现出对专有模型的强大可移植性,在 GPT-3.5-Turbo 和 GPT-4o-mini 上实现了 100% ASR,在 Claude-Sonnet-3.5 上实现了 60%(提高了 24%)。这项工作强调自动化系统设计是人工智能安全评估的强大范例,可以跟上快速发展的模型的步伐。
