论文

HSAP:混合上下文生成模型的分层序列感知并行性

HSAP: A Hierarchical Sequence-aware Parallelism for Hybrid-Context Generative Models

AI 基础设施分布式训练基础设施

摘要

在本文中,我们的目标是结合现有序列并行范式的优点并克服它们的缺点,其中最严重的是无法在更强的序列并行框架中正确计算混合上下文打包序列的因果注意力。用于高效预训练的打包序列和 微调 大语言模型 的实用技术导致注意力计算中的交叉污染问题,当序列长度维度不采取并行性时可以有效解决。然而,在序列并行性方面,现有方法要么忽略混合上下文序列的场景,要么相反牺牲和限制并行度来支持该场景。为此,我们创新性地提出了一种高效的序列感知并行算法,以克服跨多个设备组的密集张量传输和部分注意力计算的障碍。我们的算法利用JIT(Just-In-Time)编译来优化NCCL级别的所有设备组的通信策略。此外,我们将现有的序列并行范例集成到分层序列感知并行框架中,该框架受益于我们的序列感知算法。我们还详细阐述了分层框架的内存和通信开销管理,以优化其性能。通过多次实验,我们证明我们提出的方法在多个指标上优于其他最先进的序列并行方法。