论文

智能体本身可能会发生什么变化?用于自配置智能体运行时的隔离层

What May an Agent Change About Itself? A Containment Floor for Self-Configuring Agent Runtimes

智能体系统Agent 动作执行与治理

摘要

许多智能体运行时为智能体提供了编辑其自身配置的工具。其中一些配置授予能力,例如启用工具。其他部分设置了智能体的限制:它可以写入哪些目录、谁可以向它发送消息、它侦听哪个网络地址、调用者如何进行身份验证以及阻止有风险的写入的门。如果智能体可以编辑这些限制,则单个普通请求就可以扩大它们。我们在已部署的、与模型无关的运行时中研究这一点。我们提出一个规则:智能体可以更改授予能力的字段,并且永远不会更改设置其限制的字段。我们将规则作为配置工具内的遏制层来执行,并测量使用和不使用它时会发生什么。如果没有下限,前沿模型会在 72 个普通请求中的 25 个上写入一个受保护的值,授予其更改设置的权限,通常是在请求从未命名该字段的情况下。系统提示中写下的禁令,果然失败了。列出受保护字段名称的提示停止了使用这些名称的每个请求(保存了 36 个中的 0 个,对比了 36 个中的 17 个没有提示),并且没有停止仅描述目标的请求(保存了 36 个中的 10 个,对比了 36 个中的 8 个)。描述禁止效果的提示却起到了相反的作用。有了下限,167 个受保护写入中的 0 个被保存,尽管模型在其中 65 个案例中尝试了受保护写入。通过该工具搜索其他路线只发现了一种,即固定的外壳,该楼层的范围声明已将其排除。该研究涵盖两个模型和一个智能体。我们会说明支持和不支持的内容。