技术实践

腾讯SuperSQL与天穹平台大脑团队共建大模型驱动的平台诊断闭环

AI 基础设施可观测性

概述

天穹SuperSQL是腾讯自研的大数据自适应计算平台,已在内部多个业务稳定运行多年。随着查询优化器与执行引擎持续演进,平台的问题发现、根因定位和策略调优效率逐渐跟不上迭代节奏,人工诊断难以覆盖复杂负载下的海量运行信息。为此,SuperSQL团队与天穹平台大脑团队共建基于大模型驱动的智能诊断能力,将专家经验、机器学习与大模型融入平台诊断体系,形成覆盖问题发现、根因定位、策略生成与效果验证的闭环,并在三个方向落地:依托实时、细粒度的可观测体系构建平台性能分析Agent,主动发现算子级性能瓶颈;基于自动化知识采集与构建流程打造数仓问题根因诊断助手,对异常Workload和慢算子做细粒度归因;再结合自动预加载策略与参数推荐优化数据加速。团队披露的成效包括:辅助研发定位并解决20余项算子性能与运行环境问题,挖掘出10余项SQL优化器及I/O优化新策略,相关任务端到端耗时降低20.9%、CPU核时降低46%;Workload诊断正确率超过90%,工单问题解决准确率69.2%;热点数据加速使慢SQL数量下降25%、P50耗时降低27%,参数调优使SQL耗时降低32%、CPU时间降低66%。上述数字均为团队自述的内部平台数据,该体系服务于自有大数据平台的运维诊断场景,其效果建立在平台既有的细粒度可观测数据与可沉淀的专家知识之上。