论文

EvoSkill Injection:对自演化智能体的自主技能生成与演化进行红队测试

EvoSkill Injection: Red-Teaming Autonomous Skill Generation and Evolution in Self-Evolving Agents

模型评测智能体系统Agent Skills智能体自我改进安全与风险评测

摘要

基于LLM的代理系统越来越多地采用基于技能的架构,以减少重复推理成本并提高稳定、高效的任务执行。最近的研究提出了自我进化代理,可以根据过去的经验自主生成、完善和重用技能,以实现持续的能力进化。然而,自主技能演进引入了新的攻击面,其中恶意能力被生成、存储并作为合法技能重用。在本文中,我们将 EvoSkill 注入定义为一种针对自我进化代理的自主技能生成和进化管道的威胁模型。我们进一步提出了 SARGE(自我进化代理中的红队自主技能生成和进化),这是一个红队框架,用于通过迭代生成、升级和强化交互来评估此威胁模型。为了支持我们的框架,我们构建了 EvoSkillBench,这是一个恶意交互轨迹的基准数据集,用于在自我进化代理中诱导恶意技能的形成,并引入了 EvoSkillSafetyBench,这是一个攻击后基准,用于评估注入的恶意技能是否随后被检索并激活为有害行为。我们的评估表明,SARGE 会诱导恶意技能形成,并且注入的技能会被持久存储并重复激活,凸显了持久能力损坏的风险。

EvoSkill Injection:对自演化智能体的自主技能生成与演化进行红队测试:论文配图
图1:SARGE多试剂红色编队框架概览。结构显示,突击师、攻击者和法官人员在三个不同的攻击流中进行互动:技能一代攻击、技能升级攻击和技能强化攻击。