技术实践

腾讯云支持自动驾驶客户优化千卡训练稳定性与吞吐

AI 基础设施应用与实践可观测性分布式训练基础设施机器人

概述

腾讯云支持自动驾驶客户开展生产模型训练优化。训练对象为端到端自动驾驶感知规划大模型(多路相机与毫米波雷达在 BEV 空间融合,含障碍物感知、地图要素识别与 Diffusion 轨迹规划头,ConvGRU 做时序建模,训练数据为不可打乱帧序的连续驾驶 clip)。团队把「多机性能退化」转化为「单机毛刺率」问题:先用 nccl-tests 压测确认 AllReduce 带宽正常、通信非瓶颈,再用 Fake 数据剥离法证明 GPU 计算本身稳定,据此定位到 AllReduce 强同步下单机毛刺按 1-(1-p)^N 指数放大(p=4% 时 64 机 512 卡超过 90% 的 step 会出现毛刺)。 治理手段为把随机扰动改造为确定性代价:关闭 SimpleProfiler 的 cuda.synchronize 与 dist.barrier(观测者效应)、关闭自动 GC 改为每 400 步在两次 AllReduce 之间手动 gc.collect、NUMA 绑核(本地内存命中率提升至 96.8%、跨节点访问降至 3.2%)、TCMALLOC_RELEASE_RATE=0 改为定期手动释放、PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True、LMDB 开启 readahead、脏数据由随机重试改为缓存复用、把 ConvertToYuv 与 Resize3DV 预处理下沉 GPU、异步 DataLoader 按毛刺率预算取舍。 优化按 64 机→128 机→256 机(2048 卡)分阶段推进,慢节点经 hyper-trace 剔除后集群 step time 由 8 s+ 降到 5 s+,再经软件层优化稳定在 3.2 s。整体训练吞吐平均提升 50%,单任务训练规模从双机扩展至千卡,训练周期缩短 5 倍以上(原文称原本数月的周期缩短到一个月左右),已在自动驾驶量产模型的生产训练任务中完成交付。