技术实践

OpenAI以全双工模型和独立音频通路降低语音交互延迟

AI 基础设施应用与实践推理服务语音交互与综合语音服务

概述

OpenAI的Realtime团队希望解决语音对话中抢话、等待和工具调用打断交互的问题。GPT-Live采用可同时听与说的全双工语音模型,移除音频路径中的独立轮次检测器。音频走专用快路径,工具调用及业务逻辑通过异步RPC执行,慢工具不会阻塞媒体流。团队将原先Python asyncio实现的媒体前端与推理逻辑改为Go,披露新系统帧交付的p95达到旧系统p50水平;WARP协议则将媒体和数据启动从六次网络往返缩短到一次。上线前用生产会话进行静默影子测试。这套架构已用于ChatGPT Voice,GPT-Live API在文中仍属后续计划。