论文
超大规模的自主事件解决:用于网络运营的智能体AI架构
Autonomous Incident Resolution at Hyperscale: An Agentic AI Architecture for Network Operations
摘要
超大规模的云网络基础设施带来了独特的运营挑战,传统的人力驱动的事件响应无法跟上故障的数量、速度和复杂性。本文提出了一种用于大规模网络运营中自主事件解决的智能体AI架构。我们的系统采用多代理编排框架,其中专门的人工智能代理协作检测、诊断和修复网络事件,无需人工干预。我们描述了架构原理,包括分层代理分解、通过标准化协议进行基于技能的工具调用、来自操作运行手册的结构化知识编码、具有安全边界的渐进自治以及闭环验证。该架构已在一家主要云提供商的生产中部署,表明智能体AI系统可以对常见事件类别实现超过 90% 的自主解决率,同时通过分层授权和回滚机制保持安全保证。我们讨论设计权衡、故障模式以及大规模运行自主人工智能代理的经验教训。