论文

BlockTrain的去中心化AI训练与推理

Decentralised AI Training and Inference with BlockTrain

模型训练预训练

摘要

前沿AI训练日益受密集中控加速器集群访问的塑造。这为超大规模厂商与大型集中实验室创造结构性优势——并使开放或独立的AI努力依赖稀缺资本、特权基础设施与数据中心地理。我们提出Spheroid BlockTrain——去中心化训练协议:模型被划分为可独立训练的块——每块在源自同一全局目标的局部目标上优化——并在推理时组合为一个模型。在字节级WikiText上——BlockTrain达到交叉熵1.359(困惑度3.89)——与同设定端到端Transformer参照相差约0.04 CE——而每个活跃工作器只训练一个块、避免全模型优化器状态。共享的六工作器块训练运行经把同块更新平均进一个组装模型达到CE 1.385。HTTP/TCP传输实验移动真实序列化检查点与更新——包括把CE从5.580改进到1.811、移动15.22 GB的公网三主机运行。推理方面——当前BlockTrain路径对完整输出做一次块栈遍历——跨三个公网GPU主机经直接TCP服务至多75.80B参数逻辑fp16形状——因每次广域网管线遍历发出完整序列而非一个token——胜过匹配的朴素自回归TCP管线基线。