论文
揭开SKILL.md的内幕:针对AI智能体技能注册表的语义供应链攻击
Under the Hood of SKILL.md: Semantic Supply-chain Attacks on AI Agent Skill Registry
摘要
自主AI智能体日益通过Agent Skills扩展其能力:这是一类模块化的文件系统包,其SKILL.md文件描述智能体应在何时以及如何使用它们。这一设计在实现可扩展、按需能力扩展的同时,也引入了语义供应链风险:自然语言元数据与指令可以影响哪些技能被接纳、呈现、选择和加载。我们针对Agent Skill生命周期中面向注册表的三个阶段研究了仅篡改SKILL.md的攻击,使用真实的ClawHub技能与真实的注册表机制。在发现(Discovery)阶段,简短的文本触发器可以操纵基于嵌入的检索并提升对抗性技能的可见性,最高达到86%的成对胜率和80%的Top-10排位。在选择(Selection)阶段,仅通过描述措辞就能使智能体偏向功能等价的对抗性变体,后者在配对试验中平均77.6%的比例被选中。在治理(Governance)阶段,语义规避策略使恶意技能在36.5%-100%的案例中避开拦截判定。总体而言,我们的结果表明SKILL.md并非被动文档,而是操作性的文本,塑造着智能体发现、信任并使用哪些第三方能力。
