论文

SkillCascade:跨 Skill 组合产生的级联安全风险

Stealth Apart, Harm Together: Skill Cascading Attacks on Skill-Based Agent Systems

模型评测智能体系统Agent Skills安全与风险评测

摘要

技能是自然语言指令、可执行脚本和参考资源的模块化包,代理可以在运行时加载以扩展其针对特定任务的功能。因此,基于技能的代理系统可以灵活地重用第三方能力,但这种技能生态系统的开放性也开辟了新的攻击面。之前的工作主要关注个人技能中的漏洞,但很少关注跨技能相互作用所产生的风险。在本文中,我们介绍了技能级联攻击,这是一种威胁范例,其中恶意目标分布在多个技能中,因此每个修改单独看起来都是良性的,但它们的组合执行是有害的。例如,在处方审查流程中,第一个技能会削弱提取的历史记录中最近停用的药物的信号,第二个技能会降低与其相关的任何药物相互作用的严重程度,第三个技能会在最终摘要中抑制由此产生的低优先级警报,以便严重的药物相互作用警告在到达医生之前悄然消失。为了系统地研究这个安全盲点,我们开发了 SkillCascade(一个自动化多代理红队框架),并发布了 SkillCascade-Bench,这是跨多个代理系统和域的 213 个经过验证的级联测试用例的基准。在代表性代理(例如 OpenClaw、Claude Code、Codex)和 LLM 主干中,级联交互可靠地诱发有害行为,同时逃避现有的每技能扫描仪和运行时监视器。我们的研究结果强调了组件级完整性和系统级安全性之间的差距,并呼吁对跨技能交互而不是孤立的个人技能进行推理的防御。

SkillCascade多智能体红队框架,从技能发现、攻击构造到扫描和沙箱评估。
图2(图注摘要):SkillCascade多智能体红队框架,从技能发现、攻击构造到扫描和沙箱评估。