技术实践

Meta自研MTIA 300加速器:内置网卡与通信卸载引擎优化推荐模型训练

概述

背景:推荐与排序模型的训练瓶颈与大语言模型不同:embedding表常占模型参数99%以上,混合并行在数百加速器间产生频繁的AllReduce、AllToAll、AllGather集合通信;在GPU上这类通信以内核形式与训练计算争抢同一份资源,并发时算力损失可超过20%。做法:Meta自研加速器MTIA 300把通信作为芯片设计的一等公民:两个网络chiplet内置12个定制800Gbps RDMA网卡,封装内提供1.2TB/s总I/O带宽且不经过PCIe总线;机架内扩展(16节点内至多1TB/s)与跨机架扩展(200GB/s)复用同一组网卡,可随模型需求重新划分。芯片在12×6计算单元阵列之外设16个专用消息引擎,边缘的近存计算单元合计提供超过2.8TB/s归约吞吐,集合通信以线速执行且不占用计算网格;配套HCCL通信库把集合通信编译为带显式依赖的子图交由消息引擎自治执行,任务到达设备后主机不再参与,并与PyTorch c10d、torch.compile集成。已披露结果:HCCL机架内通信带宽至多940GB/s;在跨40加速器的1500亿参数生产推荐模型上,总通信时间比同等GPU集群快3.9倍;大矩阵乘与集合通信并发时计算吞吐损失低于0.5%。数字为Meta自述,对比集群配置细节未完整披露。边界与必要条件:芯片针对推荐排序场景定制,收益以自研软件栈与自有业务规模为前提;Meta称其架构原则将延续到下一代AI芯片,更广负载的适配仍在推进。