论文

自主AI智能体的行为治理:AgentBound框架

Behavioral Governance for Autonomous AI Agents: The AgentBound Framework

智能体系统Agent 动作执行与治理Agent Harness

摘要

自主人工智能代理越来越多地代表人类主体执行相应的行动,包括金融交易、外部通信和企业工作流程。现有的代理基础设施依靠身份联合和委派授权来验证工作负载并控制资源访问,但它无法确定是否应在当前行为和操作上下文下执行授权操作。我们推出了 AgentBound,一个运行时治理框架,为自主 AI 代理提供可验证的行为监督。 AgentBound 使用三个独立的权限来评估每个拟议的行动:委托授权、所有者签署的行为章程和现场行动合同。他们的判断是通过正式的决策模型保守地组成的,以确定在执行之前是否应该允许、审查或拒绝某项行动。为了提供问责制,AgentBound 生成可加密验证的治理收据,将每个操作与管理决策的确切委托、策略和语义工件绑定,从而实现独立的重播验证和策略来源。该框架还为长期运行的代理引入了常设委托,允许定期工作负载在不断更新的治理策略下运行,同时保留可撤销性和有限权限。我们提出了正式的基础、系统架构、治理接收协议和 AgentBound-Bench,这是一个用于评估治理正确性、权限构成和问责制的基准框架。 AgentBound 不是取代模型对齐,而是通过在授权和执行之间提供确定性治理层来对其进行补充,将治理从必须信任的流程转变为可以独立验证的流程。

自主AI智能体的行为治理:AgentBound框架:论文配图
图 1:从访问授权到可验证行为治理的范式转变。现有系统解决了代理身份和资源权利问题,但在上下文适用性方面留下了关键的执行盲点。 AgentBound 在授权和执行之间引入了不可绕过的行为治理层,将多权限策略综合为确定性判决,并附有加密签名的治理收据。