论文

RIFT-Bench:面向智能体AI系统的动态红队测试

RIFT-Bench: Dynamic Red-teaming For Agentic AI Systems

智能体系统Agent任务评测

摘要

由大语言模型(LLM)驱动的智能体AI系统正迅速演化为自主决策系统——暴露出超越传统LLM漏洞的攻击向量。既有安全评估常绑定特定实现或领域——限制跨异构系统的统一比较。为填补该缺口——我们介绍RIFT-Bench——表示驱动的动态红队测试方法学——支持跨多样智能体架构的统一评估。RIFT-Bench建立在新颖的层级表示上——以两个自动化阶段运作:发现(提取系统结构)与扫描(执行自适应对抗攻击)。它以横跨多样攻击向量与目标的105个自适应对抗探针直接评估受检系统。我们在横跨多样实现的45个智能体系统上展示所提评估管线的有效性——表明该方法有效泛化到异构智能体架构。除系统与攻击外——RIFT-Bench还支持对缓解策略的直接评估。这些关键能力使RIFT-Bench成为实践中智能体AI系统安全评估的可扩展基础。基础设施代码与基准工件见 https://tinyurl.com/RIFTBench。

RIFT-Bench:面向智能体AI系统的动态红队测试:论文配图
图 1:RIFT-Bench 管道。该框架首先从目标代码库中发现结构化的 NodeSpec 表示,然后使用该表示来实例化、执行、跟踪和评估特定于系统的对抗性探针。输出是涵盖不同指标的漏洞报告。详细信息在第 2 节中提供。 5.