论文

通过分权架构对AI智能体目标完整性的结构性强制保障

Structural Enforcement of Goal Integrity in AI Agents via Separation-of-Powers Architecture

智能体系统Agent 动作执行与治理

摘要

近期证据表明,前沿AI系统可能表现出智能体性失对齐(agentic misalignment),即生成并执行源自其内部构建目标的有害行动,即使不存在用户的明确请求。现有的缓解方法,如基于人类反馈的强化学习(RLHF)与宪法式提示(constitutional prompting),主要在模型层面运作,只能提供概率性的安全保证。我们提出Policy-Execution-Authorization(PEA)架构,一种在系统层面强制执行安全的“分权”设计。PEA将意图生成、授权与执行解耦为相互独立、彼此隔离的层,并通过密码学约束的能力令牌相连接。我们给出五项核心贡献:(C1) 意图验证层(IVL),用于确保能力与意图的一致性;(C2) 意图谱系追踪(ILT),通过密码学锚点将所有可执行意图绑定到发起的用户请求;(C3) 目标漂移检测,拒绝语义一致性低于可配置阈值的偏离意图;(C4) 输出语义门(OSG),使用结构化的 $K \times I \times P$ 威胁演算(知识、影响、策略)检测隐性胁迫;以及 (C5) 形式化验证框架,证明即使在对抗性模型被攻陷的情况下目标完整性依然得以维持。通过将智能体对齐从一种行为属性转变为结构性强制执行的系统约束,PEA为自主智能体的治理提供了坚实基础。