技术实践

火山引擎以SOP和大模型执行数据库根因分析

应用与实践AI 基础设施AI 开发与运维平台可观测性结构化分析、预测与决策

概述

veDB 原以人工诊断为主,痛点在于诊断信息分散在多个平台需逐系统登录收集、数据库原理复杂且高度依赖个人经验、关键信息缺失时只能靠问题复现。团队的落地路径分两步:先针对每一种问题场景沉淀专家定位经验的标准 SOP 指南文档,并通过反复故障演练验收 SOP 效果,做到运维人员拿来即用。再基于 SOP 在内部 SpaceX 诊断平台上构建自动化诊断工作流,工作流节点包括获取诊断信息、指标间的比较运算、调用大模型进行推理分析——把 SOP 逻辑模版与实时诊断信息一并投喂大模型,由其自行推理,输出结果不仅给出根因还展示完整推理过程(相比「if else」编程判断既可保留判断过程,也免去与 SOP 复杂度等价的工作流配置)。 告警联动侧,argos 告警平台为业务场景配置告警规则,SpaceX 把 argos 告警与智能诊断 RCA 关联并用飞书机器人打通消息链路,告警发生时把告警 context 传给智能 RCA 对象触发执行,诊断结果以卡片形式推送到运维群。诊断信息基础包括四层监控指标(资源层 CPU/IO/网卡、业务层 Proxy 端到端 QPS/RT/Error、计算层 DBEngine 内核指标、存储层 logstore/dbstore 内核指标,最常用 30s 级打点)、系统日志与实时状态。 其中全量 SQL 洞察改用系统共享内存替代外部文件、内存预取、特定数据编码与异步化写入,把整体性能开销控制在 5% 以内(官方 general log 会下降 30%+),故可常态化开启,日志经第三方 Agent 上传 TLS、由 DBW 按 SQL 模版与时间维度聚合,历史最长保存 3 年、单实例最大 T 级。 全链路时延分析则以全局唯一 trace id 串联 Proxy、DBEngine、logstore、pagestore 各组件,并用 SQL span 打点把耗时定位到具体函数/算子。