论文

FlowTrain:工业级视觉语言模型的基于流程的解耦训练

FlowTrain: Flow-Based Decoupled Training for Industrial-Grade Vision-Language Models

AI 基础设施分布式训练基础设施

摘要

视觉语言模型 (VLM) 的工业级分布式训练的效率仍然远低于单峰 LLM。现有的解决方案要么遵循为异构模块分配统一并行性的整体设计,要么采用分解部署,将模块分开,同时将它们作为批处理同步管道执行。在本文中,我们强调上述解决方案仍然不够,VLM训练可以进一步解耦。为此,我们提出了 FlowTrain,一个基于流的解耦训练框架,它将 VLM 训练重新表述为通过统一内存池协调的生产者-消费者数据流。编码器和骨干网可以在全局虚拟地址空间上独立进行。由于这种执行解耦从根本上改变了分配和调度的优化目标,FlowTrain 进一步引入了异构并行分配器,通过解决吞吐量匹配问题来分配特定于模块的并行策略。动态打包调度器用于在运行时根据实际的LLM端计算成本构建平衡的微批次。对实际工作负载的大量实验表明,FlowTrain 实现了超过 50% 的 MFU 和高达 1.7 倍的吞吐量改进,缩小了与仅 LLM 训练的效率差距。