产品与服务

HyperAcc 训练稳定性基础设施与 hyper-trace 慢节点检测工具

大规模分布式训练的稳定性工程:自动驾驶千卡集群的毛刺理论与优化实践

AI 基础设施可观测性分布式训练基础设施

概述

HyperAcc 为腾讯云提供的训练加速与稳定性产品,正文给出官方文档链接 https://cloud.tencent.com/document/product/1646/135998 ,并把分布式 GC 同步、CPU 亲和性绑定、内存分配确定性等机制统一封装为可复用的训练稳定性基础设施,本次优化借其完成工程化集成与落地。其中的慢节点检测工具 hyper-trace 由腾讯云研发团队自研:在训练进程运行期间通过内核级探针实时采集集群中每张 GPU 的 CUDA API 调用耗时分布(含 cudaLaunchKernel、cudaStreamSync 等关键调用),以 MAD(中位数绝对偏差)与 IQR(四分位距)等统计方法自动识别显著偏离集群均值的异常 GPU 与节点并生成可视化异常报告,可在数百至数千张 GPU 的集群中于一次任务运行期间完成全量扫描,把慢节点定位时间从数小时压缩到分钟级。本次 64 机训练任务中,该工具识别出 cudaLaunchKernel 耗时比集群正常水平慢约 30% 的节点:存在慢节点时集群 step time 可达 8 s+,剔除后恢复至 5 s+,再经软件层优化最终稳定在 3.2 s。