论文

重新定义智能体时代的AI红队:从数周到数小时

Redefining AI Red Teaming in the Agentic Era: From Weeks to Hours

模型评测安全与风险评测

摘要

AI系统正进入医疗、金融与国防等关键领域,但仍易受对抗攻击。AI红队是主要防御,但现有方法把操作者困在手动、库特定的工作流中:操作者花数周手工搭建工作流——组装攻击、变换与评分器;结果不理想时工作流还得重建。结果是操作者花在搭建工作流上的时间多于探测目标安全漏洞的时间。我们介绍一个基于开源Dreadnode SDK构建的AI红队智能体。该智能体基于45+对抗攻击、450+变换与130+评分器创建工作流。操作者可探测多智能体系统、多语言与多模态目标,聚焦「探测什么」而非「如何实现」。三点贡献:1. 智能体界面:操作者经Dreadnode TUI以自然语言描述目标,智能体处理攻击选择、变换组合、执行与报告,数周压缩为数小时。2. 统一框架:单一框架探测传统ML模型(对抗样本)与生成式AI系统(越狱),无需分别的库。3. Llama Scout案例:我们红队Meta Llama Scout,在零人工代码下取得85%攻击成功率、严重度最高1.0。

重新定义智能体时代的AI红队:从数周到数小时:论文配图
图 10:执行级指标仪表板显示高级安全态势分析。该平台为管理人员提供了攻击成功率、关键发现分布、跨框架合规状态以及趋势分析的全面概述,以便在人工智能系统安全投资方面做出明智的决策。