论文

ADR:面向企业智能体AI安全的智能体式检测系统

ADR: An Agentic Detection System for Enterprise Agentic AI Security

智能体系统Agent 动作执行与治理智能体互操作协议MCP

摘要

我们提出智能体AI检测与响应(ADR)系统,这是首个经大规模生产验证、用于保护通过模型上下文协议(MCP)运行的AI智能体的企业框架。我们识别出该领域三个持续存在的挑战:(1) 可观测性有限——现有端点检测与响应(EDR)工具只能看到文件写入,看不到智能体推理、提示词或连接意图与执行的因果链;(2) 鲁棒性不足——受预定义规则约束的静态防御难以泛化到多样的攻击技术和企业环境;(3) 检测成本高——基于LLM的推理在大规模下代价高昂。ADR通过三个组件应对这些挑战:用于高保真智能体遥测的ADR Sensor、用于部署前系统化红队测试与困难样本生成的ADR Explorer,以及结合快速分诊与上下文感知推理、可扩展的两级在线检测器ADR Detector。在Uber部署超过十个月,ADR在生产环境中保持可靠检测,采用规模增长至超过7200台独立主机,每日处理超过10000个智能体会话,发现横跨26个类别的数百起凭证泄露,并支撑了左移防护层(精确率97.2%,检测到206个凭证)。为验证该方法并促进社区采用,我们推出ADR-Bench(302个任务、17种技术、133个MCP服务器),ADR在其中实现零误报的同时检测出67%的攻击——F1分数比三个最先进基线(ALRPHFS、GuardAgent、LlamaFirewall)高2至4倍。在AgentDojo(公开提示注入基准)上,ADR检测出全部攻击,在93个任务中仅有3次误报。

ADR:面向企业智能体AI安全的智能体式检测系统:论文配图
图 1:企业对代理 AI 的需求和我们的贡献。 (1) 通过 ADR 传感器实现企业可观察性,(2) 通过在线 ADR 检测器和离线 ADR Explorer 进行可靠检测,以及 (3) 通过 ADR-Bench 进行企业基准测试。