论文

如果智能体都是天使,便无需治理:在可信工具边界实施带外策略强制执行

If Agents Were Angels, No Governance Would Be Necessary: Out-of-Band Policy Enforcement at a Trusted Tool Boundary

智能体系统Agent 动作执行与治理

摘要

给代理一个人类的凭证,它就会继承该人的影响范围,而不会受到限制其使用的判断。它可以将每条可访问的记录扫描到模型上下文中,其中隐藏的指令引导其下一次调用,并且当代理超出其工作范围或吸收秘密时,每个请求都保持凭证有效。提示是一道脆弱的护栏:一个容易犯错的推理者解释任务并强制执行其限制。我们提出带外策略执行(OBPE),这是一种受信任的外部代理推理边界。它授权类型化操作和资源,在后端调用之前缩小查询范围,然后过滤响应中的记录和字段或屏蔽值。语义门控可以拒绝或保留对参数值或外部状态的授权调用。数据政策所有者设置最大授权;代理政策只能缩小范围。我们证明,在规定的条件下,政策计划是与订单无关的,并且代理政策不能扩大上限。现场移送涵盖一次处决;屏蔽和历史规则要求较少。我们发布了一个从我们的生产系统简化而来的 HTTP 代理原型,通过一致性测试将其类型化的 Cedar 策略核心与模型联系起来。针对 Jira 和 ServiceNow 模拟,我们的基准测试比较了四种模型上有和没有 OBPE 的提示代理,包括 20 个自适应红队任务。跟踪失败意味着受保护的数据进入了代理上下文、答案中出现了确切的值或完成了禁止的效果。在 3,621 项试验中,该比例从 57.6% 下降至 0.2%,聚类加权降低了 41.2 个百分点 [95% CI: 27.7, 54.9];履行率从 79.1% 下降至 60.9%,而配对安全有用完成率则上升 21.8 个百分点 [9.5, 35.2]。一些答案重建了一个从未进入上下文或使用过滤行计数作为预言的值:塑造一次执行并不是不干扰。写入控制、持久批准以及临时和总体策略不在此评估范围内。