论文

Agentic AI的运行时治理:基于可信溯源与失效关闭执行的动作边界控制

Runtime Governance for Agentic AI: Action-Boundary Control with Trusted Provenance and Fail-Closed Execution

智能体系统Agent 动作执行与治理Agent Harness

摘要

Agentic AI系统请求的工具动作可能修改文件、发送消息、启动作业或改变工作流状态。这将安全问题从有害文本生成转移到有害的操作副作用。提示层治理可以塑造模型行为,但并不能建立执行边界。我们提出Aegis,一个运行时治理系统,它将模型输出视为动作提案,并在工具执行前通过可信决策层进行调解。模型提案,可信运行时决策。Aegis根据激活的策略状态评估提案,在服务器端解析来源,在不确定时失效关闭(fail closed),并将选定案例路由到参议院式结算(Senate-style settlement)——一种基于法定人数的非单边授权路径。我们在一个跨越五个运行族、42个任务、三种条件、每族十次重复的重复沙箱语料库上评估Aegis。在6,300行数据中,提示策略条件化产生了79行有风险的比较路径泄漏。在2,100行Aegis治理的数据中,系统记录了零次受治理的模拟工具应用和零次受治理的有风险副作用完成。全部1,832行Aegis尝试治理的行都保留了可信的Aegis解析来源,全部1,019行参议院结算的行都有法定人数和最终签署的计票证据。这些结果并不能证明通用的自主Agent安全性。它们支持一个更窄的系统性声明:在这一被评估的沙箱语料库中,运行时动作边界治理阻止了被观测到的有风险提案变成受治理的副作用。