论文

ShieldNet:针对智能体系统中新兴供应链注入的网络级防护栏

ShieldNet: Network-Level Guardrails against Emerging Supply-Chain Injections in Agentic Systems

智能体系统Agent 动作执行与治理Agent Harness智能体互操作协议MCP

摘要

现有关于LLM智能体安全的研究主要聚焦于提示注入与不安全的输入/输出行为。然而,随着智能体日益依赖第三方工具与MCP服务器,一类新的供应链威胁随之出现:恶意行为被嵌入看似良性的工具中,悄然劫持智能体执行、泄露敏感数据或触发未经授权的操作。尽管其影响日益扩大,目前尚无评估此类威胁的全面基准。为填补这一空白,我们提出SC-Inject-Bench,一个包含超过10,000个恶意MCP工具的大规模基准,其攻击类型体系源自MITRE ATT&CK并针对供应链威胁,涵盖25+种攻击类型。我们观察到,现有的MCP扫描器与语义防护栏在该基准上表现不佳。受此发现启发,我们提出ShieldNet,一个网络级防护栏框架,通过观察真实网络交互而非表层工具痕迹来检测供应链投毒。ShieldNet集成了中间人(MITM)代理与事件提取器以识别关键网络行为,随后由轻量级分类器进行攻击检测。大量实验表明,ShieldNet取得了强大的检测性能(F-1最高达0.995,误报率仅0.8%),同时运行时开销极小,显著优于现有MCP扫描器与基于LLM的防护栏。

ShieldNet:针对智能体系统中新兴供应链注入的网络级防护栏:论文配图
图 1:工具执行的语义级和网络级视图之间的比较。隐形工具注入攻击保留良性工具接口和输入/输出行为,逃避语义层检查,同时仅在网络级别暴露独特的运行时行为,从而激发基于网络的护栏。