论文
Agora:大语言模型 集体且无需许可的互联网规模预训练
Agora: Collective and Permissionless Internet-Scale Pretraining of Large Language Models
摘要
在数十亿到万亿参数规模上训练 大语言模型 仅限于数据中心,其中数据并行 (DP) 和模型并行 (MP) 技术假定同质加速器、高速互连和单个编排实体。因此,前沿模型的开发集中在能够组装此类集群的少数群体中。与此同时,大量的计算资源仍然无法用于训练:消费者和专业 GPU 是异构的、可抢占的、个人拥有的,并且只能通过互联网连接。我们推出了 Agora,一个可以有效利用这种计算的系统。 Agora 将互联网级链路上的带宽高效管道并行模型分片与多方、容错集体操作相结合。每个参与者仅持有模型的一个阶段,并且没有任何一方拥有全部权重。我们将这种设置称为“协议学习”:它支持集体训练、集体所有的模型,为具有经济可持续性的开源前沿训练开辟了一条道路。本报告介绍了涵盖通信高效并行性、异步优化和容错系统设计的研究成果。它的高潮是同类的第一个演示:Pluralis-8B,这是在 FineWeb-Edu 的 500B 词元上运行的 8.6B 参数模型的开放式、无需许可的预训练。该模型由 330 个贡献者节点(主要是连接互联网的消费者 GPU)进行了 40 多天的训练,全程加入和离开。该运行维持了约 170k 词元/秒和每 TFLOP 4.2 个词元的池化计算,效率为集中式 H100 基线的 63%,并且收敛到集中式参考运行的小幅范围内。