技术实践

OpenAI重构WebRTC栈交付低延迟语音服务

应用与实践语音交互与综合语音服务

概述

语音对话只有跟上说话节奏才自然,网络一旦拖后腿,用户立刻会听到尴尬停顿、打断被截断或插话延迟,这对ChatGPT语音、Realtime API开发者与交互式Agent同样成立。据介绍,OpenAI负责实时AI交互的团队为解决规模变大后相互冲突的三个约束——其中包括服务超9亿周活用户的全球覆盖——重构了WebRTC栈。方案是把包路由与协议终止拆开:信令仍到transceiver完成会话建立,媒体则先经relay进入;relay是公网暴露面很小的轻量UDP转发层,transceiver是其身后的有状态WebRTC端点。路由上复用WebRTC自带的ICE username fragment(ufrag),由服务端生成并嵌入足够的目的地元数据,使relay凭首包即可推断目标集群与所属transceiver,再以VIP为relay集群提供单一稳定入口。早期实现是基于Pion的单个Go服务同时处理信令与媒体终止。当公网UDP暴露面收敛到少量稳定地址和端口后,团队得以在全球部署同一relay模式。