论文

AutoSP:通过基于编译器的序列并行性解锁长上下文 LLM 训练

AutoSP: Unlocking Long-Context LLM Training Via Compiler-Based Sequence Parallelism

AI 基础设施分布式训练基础设施

摘要

大语言模型 (LLM) 在长上下文任务中展示了巨大的实用性,这些任务需要处理由数万到数十万个标记组成的提示。然而,现有的 LLM 训练库并没有提供易于使用的抽象来优化长上下文训练,而是专注于通过 ZeRO-3/FSDP、Tensor 和 Pipeline 并行性对具有大量参数的模型进行优化。这迫使用户重写 LLM 训练库,以将各种复杂的长上下文优化(例如序列并行性)的组合合并到训练管道中;该过程需要深入的专业知识,从而降低了开发人员的生产力。为了应对这些挑战,我们推出了 AutoSP:第一个自动优化 LLM 较长上下文训练的自动化解决方案。 AutoSP 编译模型并应用一组有针对性的优化:自动序列并行性和长上下文感知激活检查点,以可忽略不计的吞吐量成本大幅增强 LLM 可训练性。我们的评估证明了 AutoSP 在 NVIDIA 和 AMD 硬件上的功能,与竞争性手写基准相比,训练环境分别增加了 2.7倍和 2.5倍,而运行时性能的成本可以忽略不计。