论文

Agent系统黑盒红队:以风险分类驱动自动风险发现

Black-Box Red Teaming of Agentic AI: A Taxonomy-Driven Framework for Automated Risk Discovery

智能体系统Agent任务评测

摘要

智能体系统正在迅速转向生产,它们读取不受信任的输入,调用具有真实权限的工具,并自主行动,将安全面扩展到仅限聊天的模型之外。然而标准评估仍然是单轮的,无法捕获多步智能体漏洞。我们提出了一个系统的黑盒框架,用于仅需要基本系统描述的风险意识智能体评估。我们的方法引入了:(1) 将可观察行为映射到风险类别的七域分类法,(2) 全自动 SAGE-RT 红队,每个域生成 120 个对抗场景,以及 (3) 使用 LLM 法官进行人工验证的评估。具有四个基本模型的两种智能体架构(CrewAI 和 AutoGen)的实证验证揭示了令人担忧的模式:平均治理风险为 56.25%,多智能体配置中的隐私风险为 65%,智能体行为漏洞达到 85%。我们的黑盒方法无需特权访问即可有效识别关键架构漏洞,为更安全的智能体部署提供可扩展的路径。