技术实践
Meta自研面向AI规模以太网的传输协议MetaRoCE并经OCP开放规范
概述
背景:Meta的GPU集群已扩展到数十万卡、横跨多个数据中心与区域,集合通信中最慢的传输决定整个训练任务的节奏,推理侧分片间延迟直接影响数亿用户响应。传统RoCE要求网络按序交付每个帧、依赖PFC等机制保证无损,抑制了多平面大规模网络中包喷洒的性能。做法:Meta全新设计传输协议MetaRoCE,把智能从交换机移到端点网卡:网络被分解为大量细粒度逻辑路径,每条路径自带RTT、ECN状态与利用率等实时遥测;乱序到达被当作常态,每个包携带目的地直接写入最终内存,无重排序缓冲、无队头阻塞;协议只向交换机要求ECN标记与ECMP两项普遍已有的能力,不需要PFC、暂停帧、包修剪或网络内遥测;拥塞控制结合每路径AIMD与接收端公平份额速率提示。已披露结果:与AMD合作在Pensando可编程网卡上实现后,在64节点AMD GPU集群上以RCCL集合通信对比RoCEv2,吞吐更高、流完成时间更低;1%丢包下保持约86%吞吐,10%极端丢包下仍能提供有效带宽;4平面与8平面拓扑、至多4000并发连接下吞吐随平面数线性扩展,模拟平面故障时无需人工干预即可自主恢复。以上均为测试环境结果。边界与必要条件:已交付的是协议设计、参考实现与合规测试套件,规范与DPDK优化参考实现定于2026年10月OCP全球峰会发布;材料中没有Meta生产网络已部署该协议的证据,性能兑现依赖NIC厂商跟进实现;应用层RDMA Verbs API无需修改。