技术实践

百度千帆在昆仑芯集群训练多模态模型

AI 基础设施模型训练预训练AI 芯片分布式训练基础设施

概述

Qianfan-VL 是面向企业级应用场景的多模态大模型系列,涵盖 3B、8B、70B 三个规格,全部基于昆仑芯 P800 芯片、在 5,000+ 卡的超大规模分布式训练系统上完成训练。训练过程采用 3D 并行策略与通信-计算融合技术,实现 90% 以上的集群扩展效率,并高效完成 3T tokens 多模态数据的处理。 三个规格的模型共用一套框架代码,核心能力在生产环境中得到全面验证。同文另给出两个案例:LLaVA-OneVision-2.0(全开源全帧率多模态视觉语言模型)在训练与优化中依托 LoongForge 的异构并行、负载均衡等能力,使资源利用率与迭代效率获得显著改善(正文未给数字)。LLaVA-OneVision-1.5 引入全新 RICE-ViT 视觉编码器后,团队数天内完成新编码器适配,在 128 张 A800 上完成 8B VLM Stage-1.5 预训练,框架适配与性能优化开箱即用。