论文
AI智能体的运行时治理:基于路径的策略
Runtime Governance for AI Agents: Policies on Paths
摘要
AI智能体——使用大语言模型进行规划、推理和行动的系统——会产生非确定性、依赖路径的行为,无法在设计阶段被完全治理;这里所谓治理,是指在尽可能高的任务完成率与运行智能体相关的法律、数据泄露、声誉等成本之间取得恰当平衡。我们主张,执行路径是有效运行时治理的核心对象,并将合规策略形式化为确定性函数:由智能体身份、部分路径、提议的下一动作与组织状态映射到策略违规概率。我们证明,提示级指令(以及“系统提示”)与静态访问控制都是该框架的特例:前者在不实际评估路径的情况下塑造路径分布;后者评估的是忽略路径的确定性策略(即只能覆盖所有可能路径中某个特定子集)。在我们看来,运行时评估才是一般情形,且对任何依赖路径的策略而言都是必要的。我们构建了分析AI智能体治理的形式化框架,给出具体策略示例(受AI法案启发),讨论了参考实现,并指出风险校准与强制合规的限度等开放问题。