技术实践

Databricks以AI SRE智能体加速跨三大云1500个集群的事故调查

AI 基础设施AI 开发与运维平台

概述

Databricks的数百个微服务部署在三大云70多个区域的1500多个Kubernetes集群上。告警响起时,值班工程师要在SLA压力下跨仪表盘、日志与部署变更拼线索:老手几分钟完成的信号关联,新人可能耗上数小时。访谈数十个团队的值班工程师并研读复盘后发现,根因判断往往很快,上下文拼装占掉调查时间的60%至80%,runbook陈旧、专家知识分布不均,应用层看不到底层设施信号。AI SRE据此分层设计:原语层承认既有指标、日志与发布系统的真源地位,API层统一可观测性、部署与告警接口,核心引擎负责并行执行、结果关联与LLM综合,各团队自维护可组合的智能体化runbook。事故触发即并行启动平台健康检查、服务级分析与runbook执行三条调查线,先排除区域性基础设施问题,在工程师读告警前给出带证据的诊断摘要。可靠性上先跑确定性检查再让模型综合,每个结论链接到具体指标、日志行或部署diff等证据,无法确定根因时明确说明;针对代理并发猛打端点重构了API护栏。结果:覆盖150多个团队、250多名周活用户,每天运行超2000次调查并省下数小时,NOC团队反馈全公司MTTR下降。目前聚焦调查阶段,缓解动作仍由人执行;数字为厂商自述。