技术实践
Meta开源面向 AMD 平台的 GPU 通信库 RCCLX
概述
AI 模型通信模式与硬件能力持续演进,Meta 希望在 AMD 平台上快速迭代集合通信、传输层与新特性,此前已在 NVIDIA 平台开源自研传输库 CTran。此次 Meta 开源 RCCLX,即针对内部负载在 RCCL 上开发并测试的增强版本,与 Torchcomms 完整集成,并把 CTran 移植到 AMD 平台,启用 GPU 常驻集合通信 AllToAllvDynamic。针对 AllReduce 最高可占端到端延迟30%的瓶颈,博客介绍两项特性:DDA flat 算法让各 rank 直接读取彼此内存做本地归约,把小消息延迟从 O(N) 降到 O(1);DDA tree 算法拆成 reduce-scatter 与 all-gather 两步,对稍大消息把延迟降到常数因子。另为 AMD Instinct MI300/MI350 提供低精度集合通信,利用 FP8 量化实现最高4:1压缩。官方披露:在 AMD MI300X 上,DDA 较 RCCL 基线在解码(小消息)场景提升10-50%,预填充场景提速10-30%,增量 token 等待时间(TTIT)约降10%。边界方面,官方说明 CTran 功能尚未全部并入开源版;数据为官方工程博客自述,未见独立核验。