OpenAgentFlow:为异构AI智能体集群建立系统级安全边界
OpenAgentFlow: Enabling System-Wide Safety Boundaries for Heterogeneous AI Agent Fleets
摘要
由大语言模型支持的人工智能代理正在从孤立的助手演变为异构系统,其中多个代理、规划器、工具和执行后端在共享环境中运行。在这种情况下,安全性成为系统级操作治理问题:根据会话中累积的策略相关状态来决定是否应提交待处理的操作。现有的防护措施在分散的边界上运行,因此很难在跨异构执行路径的组合操作流上实施共享策略。我们提出了 OpenAgentFlow,一种控制平面/操作平面架构,它将操作-提交边界建立为共享执行接口。 GUI、API、工具和 LLM 生成的操作被标准化为公共 AgentEvent 流,并由共享的预执行策略执行点进行调解,而出处、会话状态、审计证据和可更新策略则在各个代理外部维护。这为不兼容的执行器提供了一个公共治理层,并允许新策略在不修改代理、提示、模型或执行路径的情况下生效。我们通过涵盖受控操作流测试、公共外部基准、策略更新和真实 Android 执行的补充系统评估来评估 OpenAgentFlow。在 300 个案例的控制套件上,OpenAgentFlow 实现了 94.00% 的准确率和 95.35% 的攻击阻止率。在 TS-Bench 完整的 1,220 个案例的 AgentDojo-Traj 拆分上,它实现了 97.62% 的准确率、96.59% 的不安全动作召回率和 1.96% 的安全误干预率。新的控制平面规则无需修改受保护的代理即可生效,并且相同的执行路径在实时 GUI、API/工具和 LLM 计划的 Android 执行中运行。这些结果表明,共享的操作-提交边界为跨异构代理执行路径的系统范围治理提供了实用基础。
