论文

治理不可观测之物:自主 AI 智能体的自适应运行时治理

Governing What You Cannot Observe: Adaptive Runtime Governance for Autonomous AI Agents

智能体系统Agent 动作执行与治理Agent Harness

摘要

自主 AI 智能体可能在权限完全保留的情况下变得不安全:行为漂移、对手适应、决策模式改变,而代码却没有任何变更。我们提出信息存续原理(Informational Viability Principle):对智能体的治理可归结为估计未观测风险的界 $\hat{B}(x) = U(x) + SB(x) + RG(x)$,并仅当动作的容量 $S(x)$ 以安全裕量超过 $\hat{B}(x)$ 时才允许该动作。以 Aubin 存续理论为基础的智能体存续框架(Agent Viability Framework)确立了三项性质——监测(P1)、预判(P2)与单调限制(P3)——对于已记录的失效模式而言,三者单独必要、合起来充分。RiskGate 通过专用统计估计器(KL 散度、分段对其余部分的 $z$ 检验、序列模式匹配)、一条失效安全的单调流水线,以及一个被形式化为 Aubin 调节映射实例、以终止开关作为最后手段的闭环 Autopilot,将该框架实例化;标量存续指数 $VI(t) \in [-1,+1]$ 及其一阶 $t^*$ 预测使治理从被动响应转变为前瞻预测。贡献包括理论框架、参考实现,以及对照已发表智能体失效分类法的分析性覆盖;定量实证评估被列为后续工作。