技术实践

OpenAI部署MRC多路径协议支撑超大规模GPU互联

AI 基础设施分布式训练基础设施

概述

前沿模型训练依赖在GPU之间快速搬运数据的可靠超算网络。据官方介绍,OpenAI联合AMD、Broadcom、Intel、Microsoft与NVIDIA开发了MRC(Multipath Reliable Connection)协议,并于发布当日通过开放计算项目(OCP)向业界开放。方案上,MRC不再把每张网卡视作一条800Gb/s链路,而是拆成8个100Gb/s的并行网络平面:一台64口@800G的交换机可改为512口@100G,仅用两级交换机即可全互联约13.1万GPU,而常规800G网络需要三到四级;协议用SRv6把数据包同时喷洒到所有平面及每平面的多条路径上,可在微秒级绕过故障,并简化网络控制面。官方称MRC已部署于OpenAI全部最大的NVIDIA GB200超算,包括得州Abilene的OCI站点与Microsoft Fairwater超算。效果方面,文中提到训练近期一个前沿模型期间曾重启四台tier-1交换机,而MRC之前GPU网卡与tier-0交换机间链路故障会直接导致训练任务失败;局限是8口网卡若失1口,最大速率降为八分之一。