论文

合同监控:通过权力分立管理人工智能

Contract monitoring: governing AI via separation of powers

智能体系统Agent 动作执行与治理

摘要

我们提出了一个人工智能安全框架,将工作Agent与指定其允许行为的合同绑定起来。我们展示了如何通过为监控Agent和评审分配不同的职责以及为监控人员和工作人员分配不对称的计算资源来执行和指定这些合同。我们的框架使我们能够凭经验衡量统计安全保证。该框架适用于广泛的设置,包括代码安全性和逃逸场景。

合同监控:通过权力分立管理人工智能:图1:框架如何指定契约。委托人通过选择评审器J(a,r)隐式指定契约。评审器接收Agent动作序列a及可能的违规报告r,判断该报告是否成功证明a违反契约。如果不存在关于a的有效违规报告r,则称动作a遵守契约。
图1:框架如何指定契约。委托人通过选择评审器J(a,r)隐式指定契约。评审器接收Agent动作序列a及可能的违规报告r,判断该报告是否成功证明a违反契约。如果不存在关于a的有效违规报告r,则称动作a遵守契约。