技术实践

百度优化Cosmos3-Nano的启动与多节点训练

AI 基础设施模型训练应用与实践预训练分布式训练基础设施机器人

概述

百度百舸在搭载国内主流 GPU 的 hpas.lgn7ib 实例上优化 Cosmos3-Nano-Policy-DROID:以 Parquet 列裁剪和数据拷贝路径重构把初始化从 37.2 分钟、1734 GB 峰值内存 OOM 改善为 25 秒、46 GB。把 ColorJitter 从 CPU 迁移到 GPU,使单样本处理从 2.12 秒降至 0.52 秒、吞吐从 1.35 提升至 2.03 sample/s/GPU。 调整 mix-order reduction 解锁 torch.compile 后吞吐达 2.61,再以分层 Activation Checkpointing 提至 2.69 sample/s/GPU。多机侧采用百度百舸 ERI 弹性 RDMA、HSDP 与计算通信重叠优化,在 12 节点 96 卡上取得 98.3% 扩展效率。 整体训练启动提速 89 倍、单机吞吐提升 99.3%、MFU 达 0.42,Loss 曲线与官方 Baseline 收敛趋势一致。