SkillGate:编码智能体 中成本高效的运行时恶意技能文件检测
SkillGate: Cost Efficient Runtime Malicious Skill File Detection in Coding Agents
摘要
软件工程团队现在将 AI 编码智能体(Cursor、Claude Code、GitHub Copilot)部署为一流的生产力工具,安装特定于领域的技能文件以根据项目 API、框架约定和组织工作流程定制代理行为。这些复杂的 Markdown 文件可以通过单个 npx Skills add 命令轻松从公共注册表下载,无需真正的安全筛选,代表了一种新颖的供应链攻击面:恶意技能文件可以默默地重新编程代理行为、窃取凭据、将后门注入生成的代码或将代理操作重定向到攻击者控制的端点。这种威胁并非假设:最近的报告记录了公共注册表中的数百个恶意技能包,其中包括通过虚假生产力技能分发凭证窃取信息窃取者的有组织活动。针对此攻击面不存在系统的工具链防御。我们推出 SkillGate,这是一种可部署的安全网关,可在安装 编码智能体 之前筛选 AI 技能包。 SkillGate 使用混合正则表达式预过滤器 + LLM 判断管道:安全信号文件完全绕过 LLM(跳过节省);标记的文件仅将其匹配的片段窗口发送给法官,而不是完整的内容(片段节省)。我们针对两个现有工具回答了四个研究问题,涵盖了 SkillsBench 基准测试的检测有效性、筛选成本、运行时间开销和误报行为。在 SkillsBench(n=1,650,9.1% 恶意)上,SkillGate 实现了 F1=0.817、FPR=1.13%,同时与全文件筛选相比,LLM 输入标记减少了 77%,并且在与阈值无关的 AUPRC 上的性能比现有工具高出 5-6 倍(0.830 与 0.144/0.162)。