技术实践
火山引擎以模型预测辅助数据库重保观测
概述
新客户搬迁上云或客户重要大促等活动期间故障风险最高,原做法是为每个重保客户单独配置告警与巡检、并安排专人值守盯盘(此类现象不一定代表问题,不适合进告警;判断逻辑复杂,也不适合进定期巡检)。团队为此引入自动化 AI 观测:定时获取核心关键指标做两类判断——实时状态检查沿用告警判断逻辑但阈值更低,未来趋势判断借助 AI 大模型综合分析,由大模型根据过去一段时间的数据变化规律分析未来趋势以识别潜在风险(如资源使用增长趋势、指标骤升骤降、违反周期性规律的异常变动)。 配套监控粒度升级:常规打点多为分钟级(最常用 30 秒),为应对系统迅速劣化的极端场景,在保留全量指标分钟级打点的基础上增加核心指标的 1s/5s 秒级打点,并对使用场景分级、优先对客户重保场景开启秒级监控,结合 Fatal 应急处理信息收集能力降低秒级历史数据的保留周期,以平衡监控粒度与系统性能、存储开销。