技术实践

百度在无NVLink集群扩展Cosmos3-Super训练

AI 基础设施模型训练应用与实践预训练分布式训练基础设施机器人

概述

百度百舸在 hpas.lgn7ib 实例(实例间未部署 HPN、实例内无 NVLink,跨节点通信依托百度智能云 ERI 弹性 RDMA 互联)上完成 64B 参数 Cosmos3-Super 的 Weak Scaling 验证:沿用官方并行策略,用 PyTorch FSDP2 对参数、梯度与 Optimizer State 全量分片(data_parallel_shard_degree 随节点数从 16 扩到 512)并结合 Torch Compile 编译优化,按每卡 batch size=32 逐级扩展。 实测从 4 节点 32 卡到 64 节点 512 卡,median step time 仅从 30.12s 增至 30.90s,吞吐由 33.997 提升至 530.227 samples/s,扩展效率 97.48%(mean 口径 97.43%)。前置验证中 2 节点因 Language Compile 显存占用触发 OOM,只能保留 VAE Compile、吞吐约 14.76 samples/s,扩展到 4 节点后双 Compile 全开、吞吐跃升至 33.997 samples/s。 训练冻结负责知识表达与推理的主体网络,仅对 moe_gen、time_embedder、vae2llm、llm2vae、action2llm、llm2action、action_modality_embed 等生成相关模块开放更新,共 718 个 Tensor、约 31.26B 参数参与更新。过程中修复 FSDP2 空分片导致的 NormMonitor 与 FusedAdam 兼容问题。 4 节点与 64 节点 Loss 均从约 26 起步、50 step 后收敛至 1.7—2.1 区间,验证工程优化不影响收敛。