技术实践

百度百舸为具身训练提供云端基础设施

AI 基础设施模型训练应用与实践强化学习AI 开发与运维平台分布式训练基础设施机器人

概述

百度百舸围绕具身智能在云端的典型工作流提供 AI Infra 底座。数据环节:预置 20 多种开源具身数据集供客户直接使用,并针对预训练场景率先集成简智开源的 RealOmni 无本体数据集。同时支持在云端部署仿真环境用键盘遥操作采集轨迹、用世界模型生成数据、把真机数据上传后经数据增强模型扩增,数据存放在云端高性能存储集群并对接到训练集群或开发机。 训练环节:全面适配 RDT、GR00T N1.5、π0.5 等一系列模型并对开源模型的训练吞吐做加速优化。对双系统分层架构的两条实现路径分别提供能力——大脑在云端、参数量可扩展至 200B 以上且结构多为 MoE 的路线,提供极致吞吐的多机多卡并行训练加速并减少多机通信开销。大脑与小程序融合在 10B 以下单体模型、需部署到设备的路线,提供与模型结构解耦、与 Hugging Face 天然兼容、可快速引入社区新模型的灵活训练框架。 此外提供主流开源世界模型的多机并行训练加速能力,尤其是输入序列的多机多卡并行。评测环节:集成 Isaac、Maniskill3、RoboTwin2 等主流仿真环境与典型任务集,训练产出的 Checkpoint 可直接对接仿真环境部署评估。文中称视觉语言模型后训练吞吐大幅提升、世界模型推理延迟优化、Isaac 仿真任务 FPS 提升等能力已集成至百度百舸平台、开发者可开箱即用,并指出部分 Isaac 任务对 CPU 算力敏感(性能随 CPU 架构、主频或 Cache 大小变化)并据此做了算力平台调优。 上述性能改善均未给出量化数字。