技术实践

Uber在云原生网络可观测平台接入AI根因分析

AI 基础设施可观测性

概述

该文由Uber基础设施工程师撰写,对象是企业网络可观测平台,监控企业网络设备与IoT传感器而非生产遥测系统。背景:旧单体监控系统扩展慢、配置改动依赖手工。做法:以开源栈在Kubernetes上重建云原生微服务架构,跨USC、EMEA、APAC三区部署;采集用Telegraf,存储用Prometheus加Thanos。自研两个关键服务:Dynamic Config App持续跟踪以ServiceNow为源、存于Elasticsearch的设备库存,动态生成各Telegraf采集器的配置,设备增删或换区无需手工干预;Alert Ingestion App基于FastAPI、Celery与Redis,异步汇聚Prometheus及Meraki等第三方webhook告警,做分组去重、补充上下文与告警状态更新以减少噪音,并统一写入Elasticsearch形成可回溯的事件流。在此历史数据之上,文章称引入AI引擎分析告警以辅助定位根因、降低MTTR,并支持Slack机器人自然语言查询。自述收益包括诊断更快、模块可扩展、消除数十万美元量级的年度许可费;AI相关能力未附量化指标。