技术实践

百度在国产CPU平台迁移AI训练负载

AI 基础设施AI 芯片AI 服务器分布式训练基础设施

概述

案例一(数字人训练):百度数字人训练服务需从 Intel + P800 平台迁移至海光 + P800 平台实现国产化替代,迁移后训练性能下降 9%,影响模型训练效率与业务交付周期。算力差异分析与火焰图定位到海光 CPU 单核算力较 Intel 存在明显差距、小算子执行时间占比显著上升、关键路径函数调用次数超出预期、数据预处理与模型计算无法有效并行,形成 CPU-XPU 协同瓶颈。 优化从减少 CPU 执行间隙入手:Runtime 层通过编译优化与内存接口调用优化提升 PaddlePaddle 基础依赖包在海光平台的 kernel launch 效率,应用层用流水线并行机制合并高频调用的小型算子。结果:海光平台性能从落后 Intel 9% 转变至领先 5.18%,迁移问题解除并形成可复用的异构计算调优路径。 案例二(商业训练任务):内部商业训练任务在海光 7490 机器上训练 T5 模型时出现异常缓慢与长时间卡顿,定位原因是该平台不支持 AVX512_BF16 向量指令集,PyTorch 以单 CPU 软件模拟实现 BF16 计算导致效率急剧下降。团队比较了「BF16 转 FP32 再转回 BF16」与「修改关键 XPU 算子实现」两条路径,最终选择修改 torch.matmul、torch.relu 等关键 XPU 算子的实现逻辑以规避 BF16 模拟开销,训练速度恢复正常、BF16 计算效率显著提升,与 Intel 平台性能打平。