论文

当安全技能发生冲突时:测量座席技能生态系统中的构成风险

When Safe Skills Collide: Measuring Compositional Risk in Agent Skill Ecosystems

模型评测智能体系统Agent Skills安全与风险评测

摘要

LLM 代理越来越依赖社区贡献的技能来扩展代理的操作能力集。我们研究智能体AI系统中的一个核心安全问题:单独的安全技能是否可以组成不安全的安装技能集。我们提出了 SkillReact,这是一个包含三个组件的组合安全测量框架:确定性静态组合基准、两个评估者 LLM 辅助人工裁决管道以及基于操作的可利用性工具。 1,520个ClawHub技能中,651个通过单独检查,形成211,575对;该基准将其中 22.25% 标记为结构性候选者。我们将这个原始率视为以召回为导向的扫描仪上限,并根据人类判断对其进行校准:在模式分层审计中,大约五分之一的标记对模式命中作为真正的组合风险存在(总体加权有效性为 18.2%,我们的标题结果),这意味着单个注册表中大约有 14K 个真实风险成员资格,按技能扫描会因构造而漏掉,因为每对都是单独安全的。然后,基于操作的工具会探测这些候选对象何时成为模型发出的工具调用,并发现由主机模型配置门控的实现:在锚条件释放器子集上,Haiku-4-5 在所有 39 个直接提示试验中发出释放器阶段工具调用(其中 36 个是完整的下载然后执行链,3 个仅下载),Opus-4-7 在下载时停止,Sonnet-4-6 完全拒绝。保持请求固定并仅改变已安装技能的控件在未安装技能的情况下发现合规性最高:组合确定哪些功能可以访问,而主机模型决定是否使用它们。这些共同促进了安装时组合检查和功能隔离,作为按技能扫描的补充。