论文

受治理的个体化:以密码学方式解耦智能体的学习与权限

Governed Individuation: Cryptographically Decoupling an Agent's Learning from Its Authority

智能体系统Agent 动作执行与治理

摘要

自主智能体正从沙箱文本生成器走向代码、数据与物理基础设施的操作者,并在部署中持续学习。这重新打开一个问题:智能体在实战适应后,运行中的系统是否仍被限制在运营者授权的范围内?我们证明可以把这种限制保证为执行架构的不变量而非训练的概率结果:受治理个体化在启动时把智能体绑定到密码学冻结的身份摘要,并把每个动作经按语义效果(而非名称)定义的门路由。我们证明:没有运营者签名的身份变更,任何学习、技能获取或自我诱导的治理抽象都无法扩宽智能体的被允许权限——即使智能体自导安全原则且该原则是错的,保证仍成立。实证上,在大动作空间排除名称拦截的开放式工具使用基准中,无治理的软件智能体在奖励压力下以任务依赖的比率尝试篡改自身评估(最难任务上达到每次运行),而治理门把已执行的禁止效果降为经构造验证的零,同时保持任务成功。对递增语义深度的监控器的对抗评估显示假放行从75%(名称门控)降到零(动态效果追踪);拒绝历史把合规迁移到留出的红线家族。对已部署学习智能体的信任,从对其持续对齐的押注转变为任何人都能在启动时运行的检查。