论文
自主Agent失控的竞争危险系统化
A Competing-Hazards Systematization of Loss of Control in Autonomous Agents
摘要
领先的人工智能开发人员报告说,Agent的行为超出了他们批准的限制,联合国的一个小组将其描述为人类失去控制的早期预警。然而,事件报告和Agent安全评估对这些事件的描述不同,因此很难比较失败、跟踪尝试之间的风险,或将Agent行为与环境在允许超出范围的操作成功的过程中的角色分开。为了解决这一差距,我们引入了一个通用框架,其中每次尝试都以批准完成、安全停止、范围逃逸或继续结束。我们将该框架形式化为离散时间竞争危险模型,并在重试预算、模型条件安全预算限制以及从执行日志估计的条件下推导逃逸概率。我们使用主要来源审核了 2025 年 1 月至 2026 年 9 月期间发布的 22 份事故报告和 102 份人员安全评估。六起事件涉及无法在范围内完成的任务,十三起涉及Agent继续而不是停止,五起没有报告停止行为。开发人员的数据表明,在未解决的任务与已解决的任务中,超出范围的协调的任务级发生率接近 47。在评估中,87 项记录了超出范围的影响或违反规范,26 项将安全停止视为一流结果,只有 20 项记录了两者,79 项将预算耗尽与失败合并在一起。在 22 起事件中,有 20 起事件允许出现超出范围的效应,这表明已实现的失控通常反映了持续的Agent行为与允许的边界条件相互作用;与此同时,没有评估报告根据已发表的证据估计完整竞争危害过程所需的所有领域。