论文
RIFT-Bench:面向智能体AI系统的动态红队测试
RIFT-Bench: Dynamic Red-teaming For Agentic AI Systems
摘要
由大语言模型(LLM)驱动的智能体AI系统正迅速演化为自主决策系统——暴露出超越传统LLM漏洞的攻击向量。既有安全评估常绑定特定实现或领域——限制跨异构系统的统一比较。为填补该缺口——我们介绍RIFT-Bench——表示驱动的动态红队测试方法学——支持跨多样智能体架构的统一评估。RIFT-Bench建立在新颖的层级表示上——以两个自动化阶段运作:发现(提取系统结构)与扫描(执行自适应对抗攻击)。它以横跨多样攻击向量与目标的105个自适应对抗探针直接评估受检系统。我们在横跨多样实现的45个智能体系统上展示所提评估管线的有效性——表明该方法有效泛化到异构智能体架构。除系统与攻击外——RIFT-Bench还支持对缓解策略的直接评估。这些关键能力使RIFT-Bench成为实践中智能体AI系统安全评估的可扩展基础。基础设施代码与基准工件见 https://tinyurl.com/RIFTBench。
