论文

AgenticRed:优化 Agentic 系统以实现自动化红队

AgenticRed: Optimizing Agentic Systems for Automated Red-teaming

智能体系统Agent Harness

摘要

虽然最近的自动化红队方法有望系统地暴露模型漏洞,但大多数现有方法依赖于人类指定的工作流程。这种对手动设计工作流程的依赖会受到人为偏见的影响,并且使得探索更广泛的设计空间变得昂贵。我们推出 AgenticRed,这是一种自动化管道,利用大语言模型的情境学习来迭代设计和完善红队系统,无需人工干预。 AgenticRed 不是在预定义结构内优化攻击者策略,而是将红队视为系统设计问题。受元代理搜索等方法的启发,我们开发了一种使用进化选择来进化代理系统的新颖程序,并将其应用于自动红队问题。 AgenticRed 设计的红队系统始终优于最先进的方法,在 HarmBench 上的 Llama-2-7B 上实现了 96% 的攻击成功率 (ASR)(提高了 36%),在 Llama-3-8B 上实现了 98% 的攻击成功率 (ASR)。我们的方法表现出对专有模型的强大可移植性,在 GPT-3.5-Turbo 和 GPT-4o-mini 上实现了 100% ASR,在 Claude-Sonnet-3.5 上实现了 60%(提高了 24%)。这项工作强调自动化系统设计是人工智能安全评估的强大范例,可以跟上快速发展的模型的步伐。

AgenticRed:面向红队测试的Agentic系统进化
图1:注意:内容为合成、虚构且不可操作;示例仅用于说明安全失效模式。其他红队测试范式与 AgenticRed 的比较。以往方法通常依赖 (1) 预定义的攻击策略、(2) 经强化学习微调的攻击者模型,或 (3) 固定结构的智能体系统。相比之下,AgenticRed 在智能体系统工作流上进行进化搜索:生成候选红队测试系统,针对目标模型进行评估,并在每一代保留最佳候选系统。