技术实践
Databricks以全生命周期检测维护GPU运行可靠性
概述
Databricks在 AI 训练推理可靠性场景中应用AI。大规模 GPU 失效分三类:会自己报错的作业崩溃、悄悄拖慢最慢 GPU 吞吐的静默降速、以及产生错误结果的数值损坏。其健康检测体系覆盖节点全生命周期——工作负载启动前校验 GPU 硬件、负载下监测静默退化、作业之间探测节点间 NCCL fabric 健康;并用智能体编码 RL 等多样的大规模负载做压力测试,在问题扩散到生产前暴露 fabric 抖动、热点与集合通信边界情况(发布方自述口径)。