论文
作为受管自主的智能:代理式AI系统的失效、升级与治理
Intelligence as Managed Autonomy: Failure, Escalation, and Governance for Agentic AI Systems
摘要
随着自主和代理式 AI 系统在机器人以及人机环境中扩展,管理幻觉和持续存在却缺乏正当依据的行动仍是开放挑战。本文没有把这些失效仅仅归因于模型或对齐层面的局限,而是探讨了无界自主性这一架构脆弱性——即无论不确定性如何上升,代理都应继续运行的假定。它引入受管自主性理论,通过检测认知漂移、暂停推理、尝试恢复并最终在可靠性下降时交出控制权的形式化能力来定义智能行为。我们通过 SMARt(Self-Managing Multi-tier Autonomous Reasoning with Regulated/Revoked transitions)模型实例化这一理论,该模型是一个具有 Stable、Meta-cognitive、Assisted 和 Regulated 四个状态的分层框架。通过建立带时间与守卫的 Petri 网形式化,我们为该系统确立了理论上有界的性质,展示架构如何在给定条件下形式化地强制升级、约束无效输出并确保治理可达性。我们进一步分析了在完备性与可靠性准则得到满足的前提下,如何在多样化运行场景(如医疗、机器人等)中纳入领域特定触发集,从而系统性地保障安全。由于这些触发器被设计为自适应的,SMARt 模型能够支持代理运行范围随时间的安全、受控扩展。我们的结论是:在自主性生命周期内对失效管理进行形式化,是实现可靠且受治理的人工智能的关键一步。