论文

揭开SKILL.md的内幕:针对AI智能体技能注册表的语义供应链攻击

Under the Hood of SKILL.md: Semantic Supply-chain Attacks on AI Agent Skill Registry

模型评测智能体系统Agent Skills安全与风险评测

摘要

自主AI智能体日益通过Agent Skills扩展其能力:这是一类模块化的文件系统包,其SKILL.md文件描述智能体应在何时以及如何使用它们。这一设计在实现可扩展、按需能力扩展的同时,也引入了语义供应链风险:自然语言元数据与指令可以影响哪些技能被接纳、呈现、选择和加载。我们针对Agent Skill生命周期中面向注册表的三个阶段研究了仅篡改SKILL.md的攻击,使用真实的ClawHub技能与真实的注册表机制。在发现(Discovery)阶段,简短的文本触发器可以操纵基于嵌入的检索并提升对抗性技能的可见性,最高达到86%的成对胜率和80%的Top-10排位。在选择(Selection)阶段,仅通过描述措辞就能使智能体偏向功能等价的对抗性变体,后者在配对试验中平均77.6%的比例被选中。在治理(Governance)阶段,语义规避策略使恶意技能在36.5%-100%的案例中避开拦截判定。总体而言,我们的结果表明SKILL.md并非被动文档,而是操作性的文本,塑造着智能体发现、信任并使用哪些第三方能力。

揭开SKILL.md的内幕:针对AI智能体技能注册表的语义供应链攻击:论文配图
图 1:针对代理技能注册表的仅 SKILL.md 语义供应链攻击概述。从良性的 SKILL.md 开始,对手仅修改自然语言内容,同时保持技能的功能结构基本不变。注入的文本可以服务于三个不同的目的:提高目标查询的注册表排名的发现触发器、使代理偏向于对抗性技能而不是功能相似的原始技能的选择触发器、以及在通过注册表端扫描时保留不安全的面向代理的意图的恶意指令。