论文
BigMac:在多模式 LLM 训练中打破计算和内存的帕累托前沿
BigMac: Breaking the Pareto Frontier of Compute and Memory in Multimodal LLM Training
摘要
训练多模态 大语言模型 (MLLM) 面临模型和数据异构性的挑战。现有系统重新设计训练管道来应对这些挑战,但仍然受到计算和内存效率之间的帕累托边界的限制,只能以牺牲另一个为代价来提高其中一个。我们推出了 BigMac,一种用于多模式 LLM 的新训练管道。 BigMac的核心思想是将编码器和生成器计算优雅地嵌套到原始LLM管道中,形成依赖安全的嵌套管道结构。通过这种设计,BigMac 将编码器和生成器的激活内存复杂度降低到 O(1),同时保持 LLM 的激活内存复杂度不变。同时,它实现了与无限内存的理想化设置相同的计算效率。因此,BigMac 打破了计算效率和内存使用之间的帕累托边界,从而能够在 MLLM 训练中同时优化计算和内存。我们在多个 MLLM 和训练工作负载上评估 BigMac。实验结果表明,BigMac 比基准系统实现了 1.08$\times$-1.9$\times$ 训练加速,同时随着批量大小的增加保持稳定的内存使用。