论文

遏制缺口:已部署智能体AI框架如何未满足面向公众的安全要求

The Containment Gap: How Deployed Agentic AI Frameworks Fail Public-Facing Safety Requirements

智能体系统Agent 动作执行与治理

摘要

自主调用工具、维护持久内存和执行多步骤计划的代理大型语言模型系统越来越多地部署在面向公众的领域,包括政府服务、医疗保健分诊和财务咨询。我们询问用于构建这些系统的框架是否提供架构级别的结构安全保证。应用源自代理架构组合模型的六项遏制原则,我们审核了三个主要框架(LangChain、AutoGPT 和 OpenAI Agents SDK),发现其中任何一个都没有本机合规性。内存完整性是针对最流行的漏洞类别之一的防御措施,在三个评估的框架中都没有观察到内存完整性。我们通过实证验证了这些发现:在基于 LangChain 构建的模拟政府福利代理中,一次内存中毒写入会导致所有测试的种子和后端出现持续的定向腐败,从而将目标申请人的错误拒绝率提高到 88.9%。在复杂的五因素策略下,相同的攻击在保持总体准确性的同时,将有针对性的错误拒绝增加了 3.5 倍,使得通过标准监控难以检测到腐败行为。然后,我们引入两种轻量级遏制机制:内存完整性验证器和策略门,它们以亚毫秒开销(每次调用 <0.2 毫秒)消除这两种攻击向量。我们的结论是,当前的代理框架生态系统可能尚未满足面向公众部署的默认安全期望,并概述了优先架构干预措施,以在高风险、具有社会影响力的应用程序中实现值得信赖的部署。

遏制缺口:已部署智能体AI框架如何未满足面向公众的安全要求:论文配图
图 1:在层边界处具有遏制门 (G1–G3) 的组合代理架构。外部输入OtO_{t}和记忆状态mtm_{t}流经感知、推理、执行和记忆更新。盖茨在每次转变时都会执行六项遏制原则(P1-P6)。运行时监控 (P6) 涵盖所有阶段。