论文
OpenART:通过开放式环境演化扩展代理红队
OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution
摘要
人工智能代理在持续的环境中运行,早期状态的变化可能会影响未来的决策。与传统的语言模型交互不同,代理行为是通过共享状态来调节的,该状态在长期工作流程中反复修改和重用。当前的安全基准通常无法捕捉这些累积风险,因为它们关注的是短期的静态任务。为了解决这些限制,我们引入了 OpenART,这是一个开放式竞技场,可通过环境演进实现可扩展的代理红队合作。 OpenART 提供了跨 50 个领域的 10,000 多个经过验证的有状态场景,取自超过 500,000 种工具和技能。这些任务平均需要 97 次工具调用,并能够跨 75 种不同的代理模型配置进行统一评估。为了系统地探索这些不断演变的攻击面,我们提出了进化马尔可夫超图攻击(EMHA)。 EMHA 是一种黑盒策略,通过协调授权状态转换来执行反馈驱动的环境演化,而无需参数更新。在整个评估过程中,任务目标保持不变,只有环境状态发生变化。在所有配置中,EMHA 的汇总攻击成功率 (ASR) 达到 85.0%。它相对于仅指令演化的优势从简单环境中的大约 2% 增加到最复杂环境中的 17% 以上,这表明随着任务复杂性的增加,环境演化越来越暴露安全故障。此外,我们的分析表明,代理的特定运行时实现解释了超出底层模型功能的安全变化的很大一部分。这些结果使 OpenART 成为研究复杂、不断变化的环境中代理安全性的可扩展基础。代码可用:https://github.com/AI45Lab/OpenART#