论文
用于安全强化的代理人工智能遏制架构
Agentic AI Containment Architecture for Security Hardening
摘要
多智能体人工智能系统越来越多地部署在自主协调、工具使用和持续学习带来新的安全和治理风险的环境中。多代理系统安全的遏制方法仍然不发达,主要依靠设计后的附加层,有时是实施和部署后的附加层。本文提出了一种代理遏制架构,它将安全性视为一种架构属性,通过一组明确的约束来强制执行,这些约束限制了多代理系统的设计空间。本文提出的架构引入了一种新颖的形式组织映射,从标准系统分析工件到所提出的约束系统下的机器可验证合约。该架构引入了六个相互作用的约束:职责分配分离、部署前一致性检查、价值流绑定、时间隔离、积累前严格的知识验证以及结构和流程完整性的确定性验证。这些约束共同强制执行提议-验证-行动-验证执行模型,其中所有操作均按合同定义、独立验证并可追溯到特定的执行上下文。该论文提出了将这些约束与针对关键威胁类别的防御联系起来的命题和正确性推理论证,包括即时注入、协调器操纵、跨会话状态中毒和紧急代理串通。简历筛选案例研究展示了该架构如何在不利条件下产生可审计的、符合政策的结果。这项工作明确地将结构完整性与语义安全分开,限制残余风险,同时使残余语义风险明确且可测量。